JEV-as-a-Judge:有把握时直接判定,不确定时升级评估
基于 LLM 的评估器能够处理多种任务,但在大规模应用中,成本和置信度的可靠性至关重要。本研究考察只输出判定的评估器能否以较低成本完成初筛,并识别需要更强评估的案例。与 16 种生成式和基于奖励模型的评估器相比,JEV-as-a-Judge 在常规偏好判断和基于证据的事实性评估中,与最强对照模型的差距不到 3 个百分点,成本仅为对方的 0.36%。在需要核查推导过程或识别措辞精巧的错误答案时,差距则更大。固定级联流程会采纳有把握的判定,并将不确定的案例升级处理;在成本更低的情况下,仍保留了对照模型 99% 的准确率。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。