论文

面向多模态大语言模型的规则合规视觉空间规划

Rule-Compliant Visual Spatial Planning for Multimodal Large Language Models

模型推理推理策略与问题分解

摘要

多模态大语言模型(MLLM)结合了语言推理与视觉感知,但其在显式或此前未见过的规则约束下执行视觉空间规划的能力仍未被充分探索。这一设定要求模型联合理解空间布局、解读自然语言规则,并据此规划有效动作。为填补这一空白,我们提出 RuleMaze,一个可控基准,其中 MLLM 必须在遵守不同复杂度自然语言规则的同时穿越迷宫。RuleMaze 通过要求准确的感知、规则解读与受约束的动作规划,来分离规则合规的空间规划能力。为实现可扩展且系统化的规则构建,我们提出语言-逻辑-函数混合化(Language-Logic-Function Hybridization),自动生成自然语言规则并将其翻译为逻辑表示与可执行验证器,消除人工规则工程。为改进规则遵循与泛化,我们提出解耦多模态规划(DMP),通过可解释的推理原语分离感知、执行与规则验证。通过解耦这些组件,DMP 促进了对更复杂和此前未见规则的系统性泛化,同时提供透明的中间规划轨迹。实验表明,与端到端文本规划基线相比,DMP 显著提高了规则合规性与规划成功率。总体而言,RuleMaze 为研究 MLLM 中基于规则、接地且可解释的空间规划建立了一个有原则的基准。代码可在 https://github.com/oceanflowlab/RuleMaze 获取。