Qwen3.8-Next 架构设计:评估、效率与训练稳定性
该研究介绍了 Qwen3.8-Flash-Next,这是一个拥有 1250 亿参数的稀疏混合专家模型,每个 token 仅激活 60 亿参数。在 14 项预训练基准测试中,该模型有 8 项超过前代 397B-A17B,其余测试最多落后 2.6 分;同时,激活参数和训练 token 数降至三分之一,训练 FLOPs 约为九分之一。其架构结合了 Gated DeltaNet、全局注意力、Qwen Sparse Attention、门控残差分支,以及存放在主机内存中的 n-gram 嵌入。研究还表明,该架构与 Muon 优化器能够提升训练效率和稳定性,并需要将损失、下游准确率、计算成本与稳定性作为一个整体进行优化。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。