原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.04299
立即前往原文

重新审视问题:维持推理模型的自我进化

这项研究探究推理模型为何在多轮自我训练后性能下降。研究发现两个主要问题:模型生成的无效问题,以及措辞不同但数学上等价的问题会绕过传统多样性筛选。R-Quest利用有效性和新颖性反馈:先训练求解模型识别并拒绝无效问题,再由冻结的基础模型评估问题对的新颖性。在涵盖数学推理、通用推理和代码生成的12项基准测试中,该方法在两个模型系列上均取得最高平均性能。连续十轮自我进化中,性能提升保持稳定;最后一轮R-Quest领先R-Zero 17.32分。
行业资讯 AI模型 研究 2026-10-08 10:30:57 892 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。