LittleLearner:在教育控制的知识暴露下研究语言模型
研究人员推出 LITTLECURRICULUM,这是一个包含 880 亿个 token、专门基于美国小学教材构建的预训练语料库。该语料库明确排除了五年级以上课程涉及的概念、事实和词汇。研究人员利用它从头训练出一个拥有 50 亿参数的语言模型 LITTLELEARNER。该模型具备足以进行开放式评估的语言能力,同时保留了清晰且可解释的知识与能力边界。模型和语料库以受控研究沙盒的形式发布,用于研究模型如何获取、表示和使用知识,以及后训练和上下文学习的作用。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。