原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.30320
立即前往原文

Qwen3.8-Next 架构设计:评估、效率与训练稳定性

该研究介绍了 Qwen3.8-Flash-Next,这是一个拥有 1250 亿参数的稀疏混合专家模型,每个 token 仅激活 60 亿参数。在 14 项预训练基准测试中,该模型有 8 项超过前代 397B-A17B,其余测试最多落后 2.6 分;同时,激活参数和训练 token 数降至三分之一,训练 FLOPs 约为九分之一。其架构结合了 Gated DeltaNet、全局注意力、Qwen Sparse Attention、门控残差分支,以及存放在主机内存中的 n-gram 嵌入。研究还表明,该架构与 Muon 优化器能够提升训练效率和稳定性,并需要将损失、下游准确率、计算成本与稳定性作为一个整体进行优化。
行业资讯 AI模型 研究 2026-09-01 12:30:56 861 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。