原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.02826
立即前往原文

通过递归式自我改写提升复杂任务表现

一项研究提出递归式自我改写(RSR)方法,将模型在专用任务环境中获得的成功解法转化为适用于通用环境的训练轨迹。规划器提取操作流程并生成手册,评审器检查验证器或解答信息泄漏并指导修订,执行器则在全新的沙箱中测试合格手册。在约3,000项经过筛选的终端任务中,三种环境合计解决759项,比记录中表现最好的单一环境多34.3%。RSR将2,001条成功的源轨迹扩展为11,094条改写轨迹。使用这些数据进行微调后,在多项Terminal-Bench评测中,模型表现优于基础模型及直接使用原始轨迹训练的模型。
行业资讯 AI模型 研究 2026-10-05 10:31:04 134 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。