原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2610.01780
立即前往原文

RealCompanion:通过推理长期真实对话评测人类理解能力的基准

RealCompanion收录了10段与AI伴侣建立的真实关系,共27,218条消息,时间跨度最长达120天。基准数据包括对话,以及据此整理的个人档案、人物设定、对话标准答案和问题;每项内容都标明了所依据的消息。研究发现,相关记忆很少是必需的,所需信息也很少来自久远以前。简单地检索近期消息,就能为95.9%的问题找到所需内容,但实际需要记忆的问题仅占2.2%。受测方法也无法可靠判断何时需要调用记忆。三种智能体系统重建人物设定的F1分数相同,但成本最高相差31倍。
行业资讯 研究 2026-10-06 01:00:59 176 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。