构建多语言桥梁:数据混合是语言内推理泛化的基础
一项研究探讨了如何让推理模型持续使用用户提示所采用的语言进行推理,而不是主要依赖英语。研究团队构建了拥有33.5亿参数的 Tiny Aya L2-Thinker,在涵盖数学、常识推理、指令遵循、开放式生成和文化推理的六项基准测试中,实现了覆盖60种语言、超过93%的语言内推理率。研究表明,更广泛的语言覆盖、多语言非推理数据,以及足够强的英语推理基础,有助于将能力泛化到未参与训练的语言。研究团队将公开模型权重和多语言推理数据。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。