原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.20758
立即前往原文

用于分解式 AI 评估的预测驱动平滑与验证方法

研究人员提出了一种评估 AI 系统的方法,用于处理系统在不同任务类型或对话类型之间表现不一致的情况。该方法将预测驱动估计与贝叶斯平滑模型结合,在标注样本较少时利用相关评估领域之间的信息,提高点估计和区间估计的准确性。研究还提出了一种近似无偏的设计型交叉验证评分,用于在直接估计量和平滑估计量之间进行选择。在可验证基准和由人工评分的实际智能体流量上进行的测试表明,该方法能够提高估计准确度,区间覆盖率也接近名义水平。
行业资讯 研究 2026-09-22 21:01:00 746 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。