原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.05324
立即前往原文

RoboSPA:VLA 模型能否超越简单场景和短期任务?

RoboSPA 是一个用于评估机器人操作中视觉-语言-动作(VLA)模型空间推理和程序推理能力的大规模数据集与基准。它涵盖 10 个任务类别、56 个基础任务,以及分布在五个难度等级中的 280 个变体,空间歧义和程序复杂度逐步提升。数据包含来自多种机器人形态和不同场景的 52.7 万条轨迹。除任务成功率外,RoboSPA 还引入了更细致的诊断指标。实验表明,当前 VLA 模型在复杂空间关系、精确的底层执行以及高记忆需求的长期规划方面仍存在明显不足。数据和代码已公开。
行业资讯 应用 AI模型 研究 开源 2026-09-09 14:31:01 621 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。