论文
世界模型遇上语言模型:论具体推理和抽象推理的互补性
World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning
摘要
世界模型和多模态 大语言模型 (MLLM) 提供了从静态视觉观察预测未来结果的互补功能。世界模型可以生成可能的未来的具体视觉展示,而 MLLM 可以对问题、目标和规则进行抽象推理。然而,生成的执行轨迹是随机的,并且可能在视觉上看似合理,但任务不正确,因此有必要确定视觉模拟何时有用、执行轨迹是否可信以及它应如何影响最终答案。我们将这个问题表述为受控具体推理,其中模型学习调用、验证并将视觉未来模拟与抽象推理相结合。为了研究这种设置,我们构建了两个经过人类验证的基准,用于可控空间前瞻的 VRQABench 和用于开放域物理预测的 OpenWorldQA,并提出了 Privileged-Future 同策略 Self-蒸馏 (PF-OPSD)。在训练期间,PF-OPSD 仅使用 真值 未来视频和答案作为教师端特权上下文来评估 同策略 具体推理轨迹,而可部署的学生在测试时永远不会观察到真实的未来。实验结果表明,PF-OPSD 在 VRQABench 和 OpenWorldQA 上的性能分别优于基线 10.6% 和 10.9%,同时提高了对噪声或冲突执行轨迹的鲁棒性。我们的代码和数据集可在 https://github.com/yczhou001/PF-OPSD 获取。