让循环模型设计得更好,第二部分:从固定点重新思考
这项研究探讨如何利用状态趋近固定点的特性,降低循环语言模型的训练和运行成本。该方法支持截断反向传播、在几乎不损失准确率的情况下共享终端 KV 缓存,并加快强化学习更新。蒸馏后的学生模型预填充速度最高提升至 1.79 倍。研究还改进了深度先验和输入注入:通过预测反馈学习的先验以及正交注入,使 1 亿至 16 亿参数模型的困惑度均有所下降。在 16 亿参数规模下,KV 缓存缩小至三分之一,仍达到使用完整缓存的固定深度训练在下游任务上的平均表现。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。