难度自适应树结构策略优化扩大RLVR的推理覆盖范围
基于可验证奖励的强化学习(RLVR)能够提升大型推理模型的单次回答准确率,但往往难以扩大以pass@k衡量的内在解题覆盖范围。研究提出DATPO,通过难度自适应树搜索、句子熵引导的分支,以及鼓励兄弟路径多样性的优势项,优化训练阶段的rollout。在数学推理基准测试中,DATPO尤其在pass@k上优于基线方法,并进一步提升了测试时扩展的性能。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。