CAFE:自我改进的搜索智能体需要共同演化的反馈
CAFE(Coupled Agent–Feedback Evolution)通过交替训练搜索智能体和批评器,使二者共同改进。该框架学习智能体应在何时请求反馈,以及如何利用反馈在错误累积前修正正在进行的搜索轨迹。它结合在线强化学习与离线偏好优化,从成功和失败的轨迹中学习反馈策略。在七项智能体搜索基准测试中,CAFE平均优于所评估的基于强化学习的搜索智能体,在六项域外基准测试中保持性能提升,并减少了答案层面的幻觉。消融实验表明,只改进智能体或批评器最终会出现性能瓶颈,而交替更新两者可以持续提升。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。