原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.19554
立即前往原文

VABench通过视觉演示、主动感知和度量控制评估具身空间智能

VABench评估多模态大语言模型能否在机器人任务中完成观察、行动和修正的完整闭环。模型从RGB演示中学习程序性上下文,主动选择摄像机视角,输出度量笛卡尔目标,并根据执行反馈进行修正;系统不提供物体的特权位姿信息或标准轨迹。该基准包含14个基础任务族、未见过的几何与布局变体,以及涉及五个物体的长时程任务。表现最佳的模型在目标定位上达到100%,在空间关系上达到78.9%,但三次运行的平均任务成功率仅为53.93%。在一项配对比较中,主动相机控制将成功率从27.86%提升至57.50%。迁移到未见几何结构时,任务成功率可能下降超过30个百分点;没有任何模型完成严格的长时程任务。
行业资讯 应用 AI模型 研究 2026-09-18 10:31:12 574 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。