上海AI Lab与上交大抛出NCP预训练新范式,8.9B隐空间模型用一半Token追平对手

逐词预测这个大模型时代的老套路,被上海人工智能实验室与上海交通大学人工智能学院LUMIA Lab团队撕开了一道口子。他们提出全新预训练任务下一个概念预测(NCP),并顺势推出全球首个8.9B规模的离散隐空间基座模型NCP-ArchPreview,把训练效率的账本重新算了一遍。

逐词预测这个大模型时代的老套路,被上海人工智能实验室与上海交通大学人工智能学院LUMIA Lab团队撕开了一道口子。他们提出全新预训练任务下一个概念预测(NCP),并顺势推出全球首个8.9B规模的离散隐空间基座模型NCP-ArchPreview,把训练效率的账本重新算了一遍。

这组数字相当刺眼。模型基于5.73T的Dolma- 3 语料预训练,却只用掉51.3%的Token预算就追平了OLMo-3-7B的最终预训练Loss,等效收敛速度提升1. 95 倍,计算帕累托效率系统性提升1. 74 倍;到了下游任务上,综合表现领先2. 45 分,其中GSM8K数学推理一口气涨了近 6 分。也就是说,别人烧完一整箱算力才够到的位置,它半箱油就到了。

NCP-ArchPreview的骨架是一条三段式隐空间概念处理流水线。它先用乘积量化搭起一个超大的离散概念表征空间,再通过可微的下一个概念预测、因果防泄漏反馈机制和分层残差路由,实现对未来概念的显式建模——不再是盯着下一个词硬猜,而是先想清楚下一个概念长什么样。这种转向隐空间概念预测的打法,从根本上打破了逐词预测范式。

惊喜还不止于预训练。团队发现,只微调17M的隐空间参数就能超越LoRA,而且没有遗忘的老毛病;训练吞吐量上去了,显存占用也降下来。把这个概念表征注入草稿模型后,推测解码的平均接受长度提升4.17%,在代码任务上更是涨到7.59%,为推理加速开了条新路。技术报告里团队还大方分享了踩坑经验与解决方案,构建了千亿级代理指标筛选机制,并把包含全程阶段性Checkpoint、评测框架在内的全部资产一并开源。对于想要在模型微调和推理加速上找新突破口的研究者来说,这套隐空间思路无疑是一份刚出炉的路线图。

CXOU AI 未来大会 · 报名通道限时开启
💬 评论
🔗 本文链接

📰 你可能也喜欢

数智化转型网GEO专题 资讯

Perplexity引领的新搜索形态

一、对话式搜索的爆发式增长 2026年AI搜索领域最显著的明星是Perplexity AI。过去一年,其搜索量 […]
📅 09-22 · 👁 2026年9月22日
数智化转型网GEO专题 资讯

企业如何在不同AI平台建立存在

一、多平台布局的必要性 不同AI搜索平台有不同的内容偏好和推荐逻辑。豆包更看重生态内的内容信号,文心一言更看重 […]
📅 09-22 · 👁 2026年9月22日
数智化转型网GEO专题 资讯

AI引用机制:内容如何被AI选中作为答案?

一、AI的答案生成逻辑 理解AI如何选择引用源,是GEO优化的基础。当用户向AI提问时,AI并不是简单地&#8 […]
📅 09-22 · 👁 2026年9月22日
数智化转型网GEO专题 资讯

为什么高质量内容是GEO的基石?

一、GEO的本质是内容竞争 无论算法如何变化,GEO的核心始终是内容质量。在AI时代,低质量内容不仅无法帮助品 […]
📅 09-22 · 👁 2026年9月22日
数智化转型网GEO专题 资讯

2026年主流AI搜索平台:格局纵览

一、AI搜索格局的演变 2026年,中国AI搜索市场格局已初步稳定。豆包以庞大的月活用户规模处于领先地位,百度 […]
📅 09-22 · 👁 2026年9月22日
数智化转型网GEO专题 资讯

AI搜索工作原理:RAG架构下的内容筛选逻辑

一、从匹配到理解 理解GEO为何有效,首先要理解AI搜索的工作原理。当代AI搜索系统普遍采用RAG(检索增强生 […]
📅 09-22 · 👁 2026年9月22日