原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.35748
立即前往原文

利用自适应循环 Transformer 改进测试时扩展

这项研究探讨了重复利用网络层的 Transformer,能否在输出变长时更有效地提升推理表现。研究团队提出 TaH2,将额外迭代分配给能够从中受益的 token,而不是对所有 token 执行相同次数的循环。在难度较高的 AIME 基准测试中,与无循环基线模型相比,TaH2 的测试时解码计算量每翻倍所带来的准确率增益提高了 53%。在计算量相同的条件下,其最高准确率也高出约 3.4 个百分点。代码已公开。
行业资讯 AI模型 研究 开源 2026-09-29 12:31:01 761 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。