通过递归式自我改写提升复杂任务表现
一项研究提出递归式自我改写(RSR)方法,将模型在专用任务环境中获得的成功解法转化为适用于通用环境的训练轨迹。规划器提取操作流程并生成手册,评审器检查验证器或解答信息泄漏并指导修订,执行器则在全新的沙箱中测试合格手册。在约3,000项经过筛选的终端任务中,三种环境合计解决759项,比记录中表现最好的单一环境多34.3%。RSR将2,001条成功的源轨迹扩展为11,094条改写轨迹。使用这些数据进行微调后,在多项Terminal-Bench评测中,模型表现优于基础模型及直接使用原始轨迹训练的模型。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。