原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.39102
立即前往原文

虚假进步:诊断并缓解自我进化搜索智能体中的共同作弊

自我进化搜索智能体可能提高内部奖励,却没有同步提升实际正确率:提问生成器和解答器会逐渐相互强化相同的错误。研究将这种现象称为“共同作弊”(co-cheating)。研究提出 CrossFit:用仅在另一组文档上训练的辅助解答器,评估根据某一组文档生成的问题。在 Qwen3.5-4B 和 Qwen3.5-9B 测试中,CrossFit 比多样本验证(MSV)更能降低错误一致。在七项搜索基准测试中,与标准的耦合式自我进化相比,平均性能分别提升 8.8 和 8.4 分。该方法能够缓解问题,但无法将其完全消除。
行业资讯 AI模型 研究 2026-10-01 15:00:55 592 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。