原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.00972
立即前往原文

VeriHarness 扩展长程任务的智能体验证能力

VeriHarness 为智能体的基础语言模型配备工作区、证据工具和可复用的验证技能,使其能够承担验证工作。系统会检查多个输出之间的分歧,也会质疑共同认可的说法,以发现错误和遗漏的要求。在五个长程任务工作区基准和两个模型上,VeriHarness 的选择得分高于所有受测基线方法。基于证据进行修订后,相比单次生成,Gemini 3.5 Flash 的表现提高了 6.2 分,Claude Opus 4.8 提高了 6.4 分。研究团队将公开约 2.6 万条生成结果。
行业资讯 应用 研究 2026-10-05 16:32:02 860 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。