原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.06833
立即前往原文

让循环模型设计得更好,第二部分:从固定点重新思考

这项研究探讨如何利用状态趋近固定点的特性,降低循环语言模型的训练和运行成本。该方法支持截断反向传播、在几乎不损失准确率的情况下共享终端 KV 缓存,并加快强化学习更新。蒸馏后的学生模型预填充速度最高提升至 1.79 倍。研究还改进了深度先验和输入注入:通过预测反馈学习的先验以及正交注入,使 1 亿至 16 亿参数模型的困惑度均有所下降。在 16 亿参数规模下,KV 缓存缩小至三分之一,仍达到使用完整缓存的固定深度训练在下游任务上的平均表现。
行业资讯 AI模型 研究 2026-10-06 12:02:11 360 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。