原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.10692
立即前往原文

SPIEval评估大语言模型处理分散个人信息的移动助手能力

SPIEval是一项由人工整理的基准测试,用于评估大语言模型作为移动助手时,从多个应用中检索和整合分散个人信息的能力。该基准包含250项任务、来自10个应用的4,335条个人记录,以及支持多轮交互的21种工具,覆盖推理、消歧、信息整合、偏好推断和多意图分解等能力。在对9个具有代表性的LLM进行评估后,表现最佳的GPT-5.5(xhigh)准确率也仅为57.3%,最弱模型为16.4%。79%的失败源于信息定位不准确:模型往往选择看似合理但实际错误的信息,而不是继续检索进行验证。不到2%的检索行为使用了高级搜索方法。研究结果显示,当前基于LLM的移动助手仍存在明显局限。数据和代码已在Hugging Face公开。
行业资讯 应用 AI模型 研究 开源 2026-08-12 11:01:01 407 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。