论文

MiniMax-H3 可以推理物理世界吗?全模态生成模型的评估

Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model

模型评测基准与评测资源

摘要

最近的全模态生成模型(Omni-Models)具有先进的内容生成功能,可实现文本、图像、视频和音频的统一建模。 MiniMax-H3 通过在共享潜在框架中将多模态上下文理解与联合视听生成结合起来,例证了这种转变。其统一架构提出了一个基本问题:多模态对齐能否改善模型的世界推理,全模态输入可以实现哪些新的评估范式?为了研究这个问题,这项工作引入了一个围绕物理世界推理的四个互补维度组织的综合评估框架。与现有的视频生成和世界模型评估框架不同,这些框架通常受到有限的输入模式和评估设置的限制,其中提示与目标视频内容紧密匹配,我们的评估是专门为利用全模型的多模态输入而设计的。我们构建了一组多样化的新颖任务,需要模型来整合跨模式的补充信息。具体来说,我们考虑四种场景,包括与多个帧、音频图像、前缀视频和音频视频输入配对的隐式提示。每种单一模态仅提供有关潜在事件的部分证据,要求模型联合推理互补的语义线索,以推断潜在事件状态和未来动态。在 517 个评估实例中,MiniMax-H3 的总体成功率为 41.97%。基于视频的决策推理的成功率最高,为 56.00%,而基于音频的消歧推理最弱,仅为 27.40%。这些结果表明,有效的多模式整合仍然是充分利用不同输入模式优势的关键。该项目位于 https://github.com/gulucaptain/MiniMax-H3-Reason。