原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.28478
立即前往原文

盲人摸象:探究大语言模型对长尾分歧知识的认知短视

研究人员推出 ElephantBench,这是一套可复现的基准测试,用于评估大语言模型是否保留罕见事实的不同说法。数据集包含1,094个问题,通过可审计的图谱式流程,从存在自然分歧的网络文档中生成。所有答案都与原始文档及权威公开来源进行核验,并由人工标注员审查。在测试的32个模型中,即使表现最好的模型,也只在52.4%的问题上同时找回两种说法。在其余大多数情况下,模型只记住一种说法而遗漏另一种。扩大模型规模和增加推理时计算可以提高召回率,但无法消除这种不完整性。研究还发现,来源曝光不均会使主流说法占据优势,而增加对少数说法的曝光则与更完整的召回相关。代码已在GitHub公开。
行业资讯 AI模型 研究 开源 2026-08-31 10:00:55 243 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。