ReactHuman:面向具身多模态大语言模型类人反应式决策的物理基础基准
ReactHuman是一项用于评估多模态大语言模型能否控制人形机器人及时、安全应对突发物理危险的基准测试。它涵盖17类事件和1,000多个可复现场景,并通过240Hz刚体模拟生成精确的标准答案。每次反应根据合理性、安全性和物理依据三个维度,以五项指标进行评分。对7个具有代表性的MLLM进行评测发现,模型大约会错误处理三分之一的危险情境。它们经常依赖固定的行为倾向或物体外观,而不是观察到的运动;即使选择了正确行动,也常常错过拦截点。这些问题并未随着模型规模扩大而减少。该基准已在Hugging Face上发布。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。