原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.40325
立即前往原文

WorldAuditBench:利用多模态智能体审计交互式3D世界

WorldAuditBench是一项用于检测交互式3D世界异常的基准测试,涵盖漂浮物体、可穿越的墙壁以及与周围场景不一致的物体等问题。该基准包含213项任务,分布在13个使用Unreal Engine 5和Three.js构建的环境中,覆盖五类异常。研究人员使用两种方法评估了五个前沿多模态模型:先由VLA进行探索,再由VLM识别异常;以及由端到端VLM智能体通过视觉推理直接选择行动。模型成功率为6.6%至42.3%,显著低于人类的83.4%。结果表明,当前多模态智能体在结合导航、证据收集与视觉推理方面仍存在明显局限。
行业资讯 AI模型 研究 2026-10-01 11:01:14 912 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。