原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.26489
立即前往原文

将校准作为大语言模型评估的核心标准

校准衡量语言模型表达或隐含的置信度与实际正确性之间的一致程度。尽管已有成熟的测量方法,NLP研究在推出新模型、数据集和基准时,却很少检查模型的置信度是否可靠。作者认为,这一缺口会妨碍可信评估,并在实际部署以及依赖置信度的研究方法中带来问题,例如让LLM充当评判者或生成合成数据。许多现有基准已经提供置信度分数和正误判断,因此可以立即报告校准结果。不过,对于开放式生成,如何定义这两项信息仍是一项挑战。作者呼吁各NLP子领域在主要性能指标之外,同时报告校准分数。
行业资讯 伦理与安全 研究 2026-09-25 00:01:01 907 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。