原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.04094
立即前往原文

DRACO:利用动态评分标准实现长程智能体训练中的细粒度信用分配

DRACO是一种用于训练长程任务AI智能体的强化学习方法,适用于缺乏可直接验证成功信号的场景。该方法在训练过程中动态生成多标准评分表,在完整轨迹结束后进行评估,再将评估结果重新分配给对相关标注标准负责的各个步骤。这样,DRACO能够为GRPO生成具有差异性的逐步优势值,而无需额外训练归因模块。在AppWorld上,DRACO比基础模型高15.9分,比使用稀疏真实奖励训练的GRPO高5.3分。在域外Tau-Bench上,即使不使用前沿模型评审,它也比基础模型高5.3分,并超过其他基于评分表的训练设置。相关代码已在GitHub开源。
行业资讯 研究 开源 2026-09-05 02:31:20 748 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。