原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.10895
立即前往原文

ReactHuman:面向具身多模态大语言模型类人反应式决策的物理基础基准

ReactHuman是一项用于评估多模态大语言模型能否控制人形机器人及时、安全应对突发物理危险的基准测试。它涵盖17类事件和1,000多个可复现场景,并通过240Hz刚体模拟生成精确的标准答案。每次反应根据合理性、安全性和物理依据三个维度,以五项指标进行评分。对7个具有代表性的MLLM进行评测发现,模型大约会错误处理三分之一的危险情境。它们经常依赖固定的行为倾向或物体外观,而不是观察到的运动;即使选择了正确行动,也常常错过拦截点。这些问题并未随着模型规模扩大而减少。该基准已在Hugging Face上发布。
行业资讯 应用 伦理与安全 研究 开源 2026-09-15 08:00:55 312 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。