原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.27448
立即前往原文

TTPO:测试时策略优化

TTPO是一种无需真实标签、在推理阶段训练大语言模型的方法。它利用多数投票生成伪标签,对与投票结果一致的输出进行蒸馏,并惩罚不一致输出中的高置信度错误,以降低错误伪标签误导整个更新过程的风险。在五项竞赛级基准测试中,TTPO达到了使用标签监督的在策略自蒸馏方法的水平。在Qwen3-1.7B上,测试时训练性能从38.0%提升至45.2%;在不进行扩展思考的情况下,研究还报告了25.2%至36.4%的提升。
行业资讯 AI模型 研究 2026-08-28 12:01:17 699 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。