原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2608.10875
立即前往原文

VibeLifeBench:评估生活智能体能否在动态世界中主动且持续地行动

VibeLifeBench是一项用于评估AI智能体的新基准,重点测试其作为个人助理长期处理日常事务的能力。该基准包含覆盖10个生活领域的200项多周任务,运行于由22个模拟服务构成的虚拟世界中。世界会自行变化,且许多变化不会主动通知智能体,因此智能体必须定期重新检查环境,保持计划连贯,并判断何时行动、提问或保持沉默。评估指标包括最终结果、行动时效性以及对隐含约束的遵守情况。研究人员测试了7个前沿模型,所有模型得分都较低,表明当前智能体距离可靠地协助真实生活仍有明显差距。任务、环境和评估框架计划以开源形式发布。
行业资讯 应用 研究 开源 2026-08-12 11:01:01 653 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。