SkillGate:训练长程智能体在策略内选择技能
SkillGate研究人工智能智能体如何在长程任务中决定读取哪项程序性技能。研究人员发现了“选择器信用饥饿”现象:在仅依据结果进行强化学习时,负责命名所选技能的少数词元几乎得不到有效训练信号;如果后续执行失败,正确的选择也可能受到惩罚。SkillGate将传递给执行词元的结果信用,与只传递给技能命名词元的局部优势信号分开。在五项智能体基准测试中,使用16个候选技能时,一个9B策略模型的试验成功率从40.8%提升至53.2%。该方法还将接触误导性候选技能的次数减少三分之二,并减少了读取的技能数量。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。