原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.05275
立即前往原文

不要放弃 Dropout:优化层稀疏性以提升大语言模型训练与推理效率

一项研究评估了层 Dropout(也称随机深度)在大语言模型训练和推理中的作用。通过优化层的分配、应用时间表和优化器超参数,该方法可以在相同计算量下获得更低损失,并在训练步数固定时节省最多 25% 的训练 FLOPs。它还支持提前退出、中间层跳过和自推测解码等训练后优化,在几乎不损失准确率的情况下,最高可将推理速度提升 1.5 倍。研究基于超过 2,400 次实验,覆盖参数量从 2.71 亿到 82 亿的模型,以及规模最大达 1,600 亿个 token 的数据集。
行业资讯 AI模型 研究 2026-09-07 10:01:05 998 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。