利用自适应循环 Transformer 改进测试时扩展
这项研究探讨了重复利用网络层的 Transformer,能否在输出变长时更有效地提升推理表现。研究团队提出 TaH2,将额外迭代分配给能够从中受益的 token,而不是对所有 token 执行相同次数的循环。在难度较高的 AIME 基准测试中,与无循环基线模型相比,TaH2 的测试时解码计算量每翻倍所带来的准确率增益提高了 53%。在计算量相同的条件下,其最高准确率也高出约 3.4 个百分点。代码已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。