Hunyuan-A13B 技术报告
报告介绍了采用混合专家架构的开源语言模型 Hunyuan-A13B。模型总参数量为 800 亿,但推理时仅激活 130 亿个参数。模型使用经过严格筛选、并加强 STEM 数据整理的 20 万亿 token 语料进行预训练,随后通过监督微调和大规模强化学习进一步提升能力。其双模式思维链框架会根据任务复杂度调整推理深度。报告称,该模型在数学、科学、编程等评测中表现具有竞争力。开发团队公开模型,以支持开放研究和实际部署。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。