Motif 3:技术报告
该技术报告介绍了 Motif 3,一款采用纯解码器 Mixture-of-Experts 架构的语言模型,总参数量为 3140 亿,每个 token 激活 132 亿参数。每个稀疏 MoE 层包含 384 个路由专家,每个 token 选择其中 8 个。模型采用分组差分潜在注意力等技术,旨在提升训练稳定性、专家专业化程度和推理效率。Motif 3 使用约 12.5 万亿个 token 进行预训练,支持最长 256K token 的上下文。其后训练流程结合了监督微调、通过强化学习训练的教师模型,以及多教师在线策略蒸馏。报告称,Motif 3 在长程智能体任务、数学推理、科学知识和对幻觉敏感的评测中,达到了与领先开放权重模型相竞争的表现。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。