原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.13545
立即前往原文

LittleLearner:在教育控制的知识暴露下研究语言模型

研究人员推出 LITTLECURRICULUM,这是一个包含 880 亿个 token、专门基于美国小学教材构建的预训练语料库。该语料库明确排除了五年级以上课程涉及的概念、事实和词汇。研究人员利用它从头训练出一个拥有 50 亿参数的语言模型 LITTLELEARNER。该模型具备足以进行开放式评估的语言能力,同时保留了清晰且可解释的知识与能力边界。模型和语料库以受控研究沙盒的形式发布,用于研究模型如何获取、表示和使用知识,以及后训练和上下文学习的作用。
行业资讯 AI模型 研究 开源 2026-08-17 15:31:18 514 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。