原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.26550
立即前往原文

JEV-as-a-Judge:有把握时直接判定,不确定时升级评估

基于 LLM 的评估器能够处理多种任务,但在大规模应用中,成本和置信度的可靠性至关重要。本研究考察只输出判定的评估器能否以较低成本完成初筛,并识别需要更强评估的案例。与 16 种生成式和基于奖励模型的评估器相比,JEV-as-a-Judge 在常规偏好判断和基于证据的事实性评估中,与最强对照模型的差距不到 3 个百分点,成本仅为对方的 0.36%。在需要核查推导过程或识别措辞精巧的错误答案时,差距则更大。固定级联流程会采纳有把握的判定,并将不确定的案例升级处理;在成本更低的情况下,仍保留了对照模型 99% 的准确率。
行业资讯 应用 研究 2026-09-23 20:00:59 699 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。