SPIEval评估大语言模型处理分散个人信息的移动助手能力
SPIEval是一项由人工整理的基准测试,用于评估大语言模型作为移动助手时,从多个应用中检索和整合分散个人信息的能力。该基准包含250项任务、来自10个应用的4,335条个人记录,以及支持多轮交互的21种工具,覆盖推理、消歧、信息整合、偏好推断和多意图分解等能力。在对9个具有代表性的LLM进行评估后,表现最佳的GPT-5.5(xhigh)准确率也仅为57.3%,最弱模型为16.4%。79%的失败源于信息定位不准确:模型往往选择看似合理但实际错误的信息,而不是继续检索进行验证。不到2%的检索行为使用了高级搜索方法。研究结果显示,当前基于LLM的移动助手仍存在明显局限。数据和代码已在Hugging Face公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。