CAST:面向可靠长程工具调用代理的批评感知监督
CAST 是一种训练框架,可将任务结果转换为动作级的结构化理由,用于解释代理的操作是否有效。这些批评信息随后被用于训练和优化执行长期、交互式工具调用任务的大语言模型代理。在动态工具调用基准测试中,使用 CAST 微调 Qwen3 系列模型后,代理的可靠性得到提升。在零售任务上,CAST 的 pass^4 表现比 GPT-OSS-120B 高出超过 10 个百分点;在跨领域的远程医疗场景中,表现又提升了 9%。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。