论文

OOWM:通过面向对象的程序化世界建模结构化具身推理与规划

OOWM: Structuring Embodied Reasoning and Planning via Object-Oriented Programmatic World Modeling

模型推理模型训练强化学习推理策略与问题分解RLVR

摘要

标准思维链(CoT)提示赋予大语言模型(LLM)推理能力,但其对线性自然语言的依赖本质上不足以在具身任务中进行有效的世界建模。文本虽然灵活,却无法显式表示稳健机器人规划所需的状态空间、对象层级和因果依赖。为解决这些局限,我们提出面向对象世界建模(OOWM),一个透过软件工程形式化视角结构化具身推理的新框架。我们不再把世界模型定义为潜在向量空间,而是显式的符号元组 W = ⟨S, T⟩:一个实例化环境状态S的状态抽象(G_state),加上表示转移逻辑 T: S × A → S' 的控制策略(G_control)。OOWM利用统一建模语言(UML)把这一定义实体化:它采用类图把视觉感知锚定到严格的对象层级,采用活动图把规划操作化为可执行控制流。此外,我们引入结合监督微调(SFT)与群组相对策略优化(GRPO)的三阶段训练流水线。关键的是,该方法利用来自最终计划的结果奖励隐式优化底层的面向对象推理结构,即使在稀疏标注下也能有效学习。在MRoom-30k基准上的大量评估表明,OOWM在规划连贯性、执行成功率和结构保真度上显著优于非结构化文本基线,确立了结构化具身推理的新范式。

OOWM:通过面向对象的程序化世界建模结构化具身推理与规划
图4:所提出的 OOWM 架构概览。输入图像经过动态分辨率切分处理,由 InternViT-300M 编码,并与文本提示融合。语言解码器(InternLM2.5)充当 OOWM 实例化器(OOWM Instantiator)。它合成序列化的符号代码而非自由格式文本,以构建两个耦合的建模组件:用于落地环境语义(推理)的状态抽象(State Abstraction)( G state G_{\text{state}} ),以及用于支配可执行清理工作流(规划)的控制策略(Control Policy)( G control G_{\text{control}} )。请放大以清晰查看细节。