TTPO:测试时策略优化
TTPO是一种无需真实标签、在推理阶段训练大语言模型的方法。它利用多数投票生成伪标签,对与投票结果一致的输出进行蒸馏,并惩罚不一致输出中的高置信度错误,以降低错误伪标签误导整个更新过程的风险。在五项竞赛级基准测试中,TTPO达到了使用标签监督的在策略自蒸馏方法的水平。在Qwen3-1.7B上,测试时训练性能从38.0%提升至45.2%;在不进行扩展思考的情况下,研究还报告了25.2%至36.4%的提升。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。