论文
视觉生成通过多模态世界模型解锁类人推理
Visual Generation Unlocks Human-Like Reasoning through Multimodal World Models
摘要
人类构建内部世界模型并通过操纵其中的概念进行推理。AI的最新进展,特别是链式思考(CoT)推理,近似了这种人类认知能力,世界模型被认为嵌入在大语言模型之中。当前系统在数学和编程等正式抽象领域已达到专家级表现,主要依赖言语推理。然而,在物理和空间智能等需要更丰富表示和先验知识的领域,它们仍远落后于人类。能够同时进行言语和视觉生成的统一多模态模型(UMM)的兴起因此激发了对扎根于互补多模态通路的更类人推理的兴趣,尽管其收益尚不明确。本文从世界模型视角出发,首次原则性地研究视觉生成何时以及如何有益于推理。我们的核心立场是视觉优越性假说:对某些任务——尤其是扎根于物理世界的任务——视觉生成更自然地充当世界模型,而纯言语世界模型会遭遇表示局限或先验知识不足带来的瓶颈。理论上,我们将内部世界建模形式化为CoT推理的核心组件,并分析不同形式世界模型之间的区别。实证上,我们识别出需要交错视觉-言语CoT推理的任务,构建了新的评估套件VisWorld-Eval。在最先进UMM上的受控实验表明,交错CoT在有利于视觉世界建模的任务上显著优于纯言语CoT,而在其他情况下没有明显优势。这项工作共同阐明了多模态世界建模对更强大、更类人多模态AI的潜力。