原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.29050
立即前往原文

SLCA-GRPO解决工具调用强化学习中的跨片段信用误归因问题

SLCA-GRPO旨在解决工具调用智能体强化学习中的一个问题:GRPO等标准方法会将相同的轨迹级优势分配给所有令牌,导致摘要生成的学习信号干扰工具决策。该方法按结构片段分别估计优势,将执行信号分配给工具令牌,将偏好信号分配给摘要令牌。结合可在无需真实API的情况下进行训练的LLM模拟器,在相同训练预算下使用7B模型时,SLCA-GRPO的表现优于GRPO、ToolPO和RLTR。研究报告称,其在域内评估中提升2.53个百分点,在BFCL上提升1.36个百分点,在τ²-Bench上提升9.15个百分点。
行业资讯 研究 2026-09-28 10:31:26 732 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。