上海AI实验室与上海交大提出NCP预训练范式,发布89亿参数隐空间模型
上海人工智能实验室与上海交通大学LUMIA Lab提出了下一概念预测(Next Concept Prediction,NCP),试图替代传统的逐词元预测预训练方式。其89亿参数模型NCP-ArchPreview使用Dolma-3语料库中的5.73万亿个词元训练。技术报告称,该模型仅使用51.3%的词元预算,就达到了OLMo-3-7B最终预训练损失水平,等效收敛速度提升1.95倍。团队还报告了下游任务性能提升,其中GSM8K提高近6分。NCP在离散隐空间中表示概念,并结合可微的下一概念预测、因果防信息泄漏反馈和分层残差路由。据称,仅微调1700万个隐空间参数就能超过LoRA,同时减轻灾难性遗忘。研究团队已公开训练检查点、评测工具及其他项目资产。
本文来源:AIbase,仅供学习参考,版权归原作者所有。