重新审视问题:维持推理模型的自我进化
这项研究探究推理模型为何在多轮自我训练后性能下降。研究发现两个主要问题:模型生成的无效问题,以及措辞不同但数学上等价的问题会绕过传统多样性筛选。R-Quest利用有效性和新颖性反馈:先训练求解模型识别并拒绝无效问题,再由冻结的基础模型评估问题对的新颖性。在涵盖数学推理、通用推理和代码生成的12项基准测试中,该方法在两个模型系列上均取得最高平均性能。连续十轮自我进化中,性能提升保持稳定;最后一轮R-Quest领先R-Zero 17.32分。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。