RealCompanion:通过推理长期真实对话评测人类理解能力的基准
RealCompanion收录了10段与AI伴侣建立的真实关系,共27,218条消息,时间跨度最长达120天。基准数据包括对话,以及据此整理的个人档案、人物设定、对话标准答案和问题;每项内容都标明了所依据的消息。研究发现,相关记忆很少是必需的,所需信息也很少来自久远以前。简单地检索近期消息,就能为95.9%的问题找到所需内容,但实际需要记忆的问题仅占2.2%。受测方法也无法可靠判断何时需要调用记忆。三种智能体系统重建人物设定的F1分数相同,但成本最高相差31倍。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。