RoboFollow揭示具身智能体指令遵循能力的假象
一项新基准测试发现,具身智能体遵循指令的能力远不如成功率所显示的那样。在场景熵较低、只有一项有效任务时,智能体可能几乎不依赖语言也能成功。RoboFollow让每个场景都包含多种可能任务,并通过分层诊断流程检验智能体能否一致地理解和执行指令。对九种VLA和WAM策略的评估显示,在简单测试中的良好表现无法可靠地迁移到更具挑战性的测试中。多种受测改进方法也未能弥合这一差距。代码和数据集现已公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。