原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.07341
立即前往原文

零差距不等于恢复:分层的逐题概率评估与基准污染的逐步缓解

公开基准数据不可避免地会进入预训练语料,模型一旦记住这些数据,评测分数就可能被高估。该研究指出,现有的 G-AP 指标存在缺陷:它依赖二元的对错结果,而且先求平均再计算差值,会让过度抑制与抑制不足相互抵消。研究提出 SA-PPG,通过采样估计每道题的解题概率,逐题与干净模型进行比较,并按干净模型的解题概率分组汇总。RailCap 则在生成过程中判断可能存在的污染;当采样结果回到贪心生成轨迹时,限制下一个最可能的词元,并持续抑制,直到输出分布足够分散。多种受污染模型和基准测试表明,既有策略显著高估了恢复效果,而 RailCap 获得了最低的 SA-PPG。
行业资讯 AI模型 研究 2026-08-10 15:31:52 932 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。