SMELT:计算量匹配的循环式 MoE Transformer 扩展定律
一项研究在混合专家(MoE)架构中评估循环式 Transformer。这类模型通过重复执行共享层块来增加有效深度,但研究在比较时匹配了每个 token 的计算量、非嵌入参数总数和 KV 缓存。研究人员提出 SMELT,让中间一半的层重复执行两次。在最大达到 540 亿个非嵌入参数的四种模型规模上,SMELT 随计算量增加呈现更快的损失下降,并在计算最优前沿节省 6.8% 至 18.0% 的训练 FLOPs。这一优势也迁移到下游基准测试,在代码任务上最明显,并且会随着样本长度和上下文示例数量增加而扩大。机制分析表明,第二次执行能够减弱注意力汇聚现象,并将注意力引向与内容更相关的 token。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。