原文跳转提示
此资讯内容来源于外部网站,将在 60 秒后自动跳转到原文页面
https://arxiv.org/abs/2609.18323
立即前往原文

MiniMax-H3能否推理物理世界?全模态生成模型评测

一项研究评估MiniMax-H3能否通过联合处理文本、图像、视频和音频,提升对物理世界的推理能力。研究团队构建了包含517个样本的评测框架,覆盖四种场景:结合多帧画面的隐式提示、音频-图像输入、前缀视频以及音频-视频输入。由于每种模态只能提供部分证据,模型需要整合互补线索,以推断事件状态和未来动态。MiniMax-H3的总体成功率为41.97%。其中,基于视频的决策推理表现最好,成功率为56.00%;基于音频的消歧推理表现最弱,为27.40%。结果表明,即使采用统一架构,有效整合多模态信息仍是充分发挥不同输入优势的关键挑战。该项目已在GitHub上公开。
行业资讯 AI模型 研究 开源 2026-09-18 20:01:00 538 阅读 阅读约 1 分钟 来源:Hugging Face
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。