论文

WOVEN:将视觉世界建模融入多模式LLM

WOVEN: Weaving Visual World Modeling into Multimodal LLMs

模型训练模型评测监督微调与指令调优合成数据基准与评测资源

摘要

多模态大语言模型 (MLLM) 与空间、具体、物理和时间推理作斗争。我们假设这些失败反映了视觉转换推理中的共同缺陷,并测试这种能力是否可以作为共享训练原语,即不同的模型可以通过系统的训练配方从不同的监督源中学习并在不同的任务中重用。现有的基准单独记录这些缺陷,但不支持跨场景、动作和推理操作的受控比较。因此,我们引入了 WOVEN,这是一种视觉过渡推理的训练源和基准,它使用来自视频预训练生成模型的多样化、真实的部署,按场景、动作和推理类型组织过渡监督:跨 20 个场景类型、5 个动作类型和 8 个推理类型的 36,076 个示例。我们首先评估了 38 个前沿 MLLM(例如 GPT-5.4 和 Qwen3-VL-235B-A22B),并发现了实质性的系统性缺陷:即使是最强大的模型也远远低于人类,并且在模型中重复出现失败 家庭并坚持规模化。然后,我们在 WOVEN 上以多种规模训练 MLLM,发现它们学习了一种可广泛迁移的共享能力:仅包含约 2,000 个项目的训练子集,每个项目总共将 26 个外部基准中的 22 个提高了 27.3 个百分点,并且 WOVEN 数据可以以相当的精度替代任务自身训练数据的 30-50%。受控比较进一步产生了视觉世界建模的训练方法,并在保留的基准上进行了前瞻性验证:通过它所教授的推理操作而不是它所显示的动作、场景或领域来选择监督,并且为了鲁棒性而更喜欢对视觉状态进行更大的改变。我们的工作将视觉转换推理作为 MLLM 中系统视觉世界模型训练的可重用基础。