不要屏蔽环境:观测监督改变强化学习中智能体的探索方式
该研究提出 ActObs,一种不仅训练动作词元、也训练观测词元的监督式微调方法。虽然部署后的智能体不会生成观测,但学习预测观测有助于策略模型理解动作后果,而且不需要额外数据、参数、序列词元或前向计算。在使用 GRPO 优化后,基于 Qwen3-4B 的 ActObs 在 Terminal-Bench 2.0 的所有测试采样预算下,都取得了高于仅训练动作方法的 pass@k。基于 Qwen3-8B 时,pass@16 提升了 3.4 个百分点,但 pass@1 的可靠性有所下降。在 aider-polyglot 的跨领域代码编辑任务中也取得了改进。分析表明,联合监督能够保留环境预测能力,从而改善强化学习过程中的探索。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。