MiniMax-H3能否推理物理世界?全模态生成模型评测
一项研究评估MiniMax-H3能否通过联合处理文本、图像、视频和音频,提升对物理世界的推理能力。研究团队构建了包含517个样本的评测框架,覆盖四种场景:结合多帧画面的隐式提示、音频-图像输入、前缀视频以及音频-视频输入。由于每种模态只能提供部分证据,模型需要整合互补线索,以推断事件状态和未来动态。MiniMax-H3的总体成功率为41.97%。其中,基于视频的决策推理表现最好,成功率为56.00%;基于音频的消歧推理表现最弱,为27.40%。结果表明,即使采用统一架构,有效整合多模态信息仍是充分发挥不同输入优势的关键挑战。该项目已在GitHub上公开。
本文来源:Hugging Face,仅供学习参考,版权归原作者所有。