将环境作为脚手架:通过丰富反馈培育长程任务中的自我进化智能体
一项研究提出“反馈增强环境”(FEE),旨在解决使用强化学习训练大型语言模型自主智能体时的奖励稀疏问题。FEE不直接指导智能体的行动,而是在探索后期丰富其观测信息。在SciWorld和BFCL基准测试中,研究人员使用不同规模的Qwen3模型以及GRPO、GSPO和DAPO算法进行大规模实验,结果显示其性能持续优于标准环境。研究表明,FEE能够稳定训练过程、促进对困难状态空间的主动探索,并使环境指导融入策略权重,而不仅仅作为推理时的先验辅助。此外,组内反馈的一致性被确定为实现稳定优化的关键条件。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。