盲人摸象:探究大语言模型对长尾分歧知识的认知短视
研究人员推出 ElephantBench,这是一套可复现的基准测试,用于评估大语言模型是否保留罕见事实的不同说法。数据集包含1,094个问题,通过可审计的图谱式流程,从存在自然分歧的网络文档中生成。所有答案都与原始文档及权威公开来源进行核验,并由人工标注员审查。在测试的32个模型中,即使表现最好的模型,也只在52.4%的问题上同时找回两种说法。在其余大多数情况下,模型只记住一种说法而遗漏另一种。扩大模型规模和增加推理时计算可以提高召回率,但无法消除这种不完整性。研究还发现,来源曝光不均会使主流说法占据优势,而增加对少数说法的曝光则与更完整的召回相关。代码已在GitHub公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。