MemUse:将对话式 AI 的记忆评估从直接问答转向自然整合
一项研究表明,传统的对话式大语言模型记忆测试未必能反映用户满意度。在一项为期4个月的部署中,40名用户进行了1,872次会话,涵盖7种记忆条件。针对过往对话事实的直接提问,准确率在19.7%至70.1%之间波动,但用户满意度没有变化。研究人员认为,直接问答测试的是系统在被明确询问时能否检索事实,而真实对话还要求系统识别信息的相关性,并将过往上下文自然融入回答。为此,他们推出MemUse,根据真实用户提示产生的记忆场景,评估信息是否被自然整合。在模型和上下文保持不变的情况下,系统直接问答准确率为78.8%,但在对话中实际引用相关事实的比例仅为7.9%。自然整合能力与满意度相关,而直接问答表现没有显示出这种关联。部署语料库、人工判断结果和评分提示词均已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。