逐步扩展:面向大规模混合专家模型的计算高效超参数迁移
一项新研究提出了一种两阶段方法,用于高效估计大规模混合专家(MoE)模型的最佳学习率。该方法首先将小型代理模型的结果迁移到不同模型宽度,随后利用缩放定律外推到超大规模的 Token 预算。在预测最高达 10 万亿 Token 的训练任务学习率时,线性回归取得了 0.95 的 R²。研究人员针对采用多头潜在注意力和 Muon 优化器的 MoE 架构,调整了最大更新参数化方法。该方法还被用于从零开始预训练一个总参数量为 1550 亿、激活参数量为 170 亿的基础模型。报告的训练和评估结果表明,在小型代理模型上进行实验,可能以较低的消融成本预测大型 MoE 模型的训练配置。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。