SLCA-GRPO解决工具调用强化学习中的跨片段信用误归因问题
SLCA-GRPO旨在解决工具调用智能体强化学习中的一个问题:GRPO等标准方法会将相同的轨迹级优势分配给所有令牌,导致摘要生成的学习信号干扰工具决策。该方法按结构片段分别估计优势,将执行信号分配给工具令牌,将偏好信号分配给摘要令牌。结合可在无需真实API的情况下进行训练的LLM模拟器,在相同训练预算下使用7B模型时,SLCA-GRPO的表现优于GRPO、ToolPO和RLTR。研究报告称,其在域内评估中提升2.53个百分点,在BFCL上提升1.36个百分点,在τ²-Bench上提升9.15个百分点。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。