用于分解式 AI 评估的预测驱动平滑与验证方法
研究人员提出了一种评估 AI 系统的方法,用于处理系统在不同任务类型或对话类型之间表现不一致的情况。该方法将预测驱动估计与贝叶斯平滑模型结合,在标注样本较少时利用相关评估领域之间的信息,提高点估计和区间估计的准确性。研究还提出了一种近似无偏的设计型交叉验证评分,用于在直接估计量和平滑估计量之间进行选择。在可验证基准和由人工评分的实际智能体流量上进行的测试表明,该方法能够提高估计准确度,区间覆盖率也接近名义水平。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。