论文

从基本构件到规划:用强化学习实现大语言模型的多步空间推理

From Building Blocks to Planning: Multi-Step Spatial Reasoning in LLMs with Reinforcement Learning

模型训练强化学习RLVR

摘要

由于在导航与规划中的应用,大语言模型(LLM)的空间推理正获得越来越多的关注。尽管具备强大的通用语言能力,LLM 在结构化环境中的空间变换与多步规划上仍然吃力。我们提出一种两阶段方法,将空间推理分解为原子构件及其组合。首先,我们对旋转、平移、缩放等基本空间变换进行监督微调,使模型具备基础的空间物理知识。随后,我们冻结这个具备物理感知的模型,在 GRPO 框架内训练轻量级 LoRA 适配器,以闭环方式学习在基于解谜的环境中把这些构件组合起来完成多步规划的策略。为支持这一流程,我们合成了一个 ASCII 艺术数据集,并构建了相应的基于 ASCII 的强化学习环境。无论是在带显式状态更新的动态(Dynamic)环境,还是在模型必须跨步骤依赖自身内部状态的静态(Static)环境中,我们的方法都稳定优于多个基线,包括通用骨干模型、物理感知模型和端到端 RL 模型。此外,与从零开始的端到端强化学习相比,所提方法收敛更快、训练更稳定。最后,我们分析注意力模式,以评估微调是否在空间理解上带来有意义的改进。

从基本构件到规划:用强化学习实现大语言模型的多步空间推理 配图
图 1:所提出训练框架的概览。该流水线遵循两阶段学习方法。在 SFT 阶段,基础模型(Qwen-Instruct)在 Building Block Dataset 上进行微调,以获取原子级空间先验(平移、缩放、旋转),得到中间模型 Qwen-Physics。在 RL 阶段,我们在闭环设置中采用带 LoRA 适配器的 GRPO。模型经训练以掌握多步空间推理与规划,最终得到 Qwen-PhysRL 模型。