几乎不增加成本,提升循环式 Transformer 的解码效果
循环式 Transformer 会反复执行共享模型块,并生成可用于预测下一个 token 的中间表示。LoopCD 无需辅助模型或额外训练,而是利用较早一轮的结果作为较弱的对照预测。在四种 Transformer 系列的测试中,Ouro-2.6B-Thinking 的 AIME 2024 pass@1 从 61.88% 提升至 73.33%,Huginn 的 HumanEval pass@1 从 22.56% 提升至 31.71%。此外,LoopCD 将循环次数减半后,仍能达到或超过完整深度、无引导基线模型的表现,并将前向传播 FLOPs 降低 22.5% 至 48.2%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。