VeriHarness 扩展长程任务的智能体验证能力
VeriHarness 为智能体的基础语言模型配备工作区、证据工具和可复用的验证技能,使其能够承担验证工作。系统会检查多个输出之间的分歧,也会质疑共同认可的说法,以发现错误和遗漏的要求。在五个长程任务工作区基准和两个模型上,VeriHarness 的选择得分高于所有受测基线方法。基于证据进行修订后,相比单次生成,Gemini 3.5 Flash 的表现提高了 6.2 分,Claude Opus 4.8 提高了 6.4 分。研究团队将公开约 2.6 万条生成结果。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。