论文

LenGuard-GPC:面向空间推理强化学习的引导提示一致性长度守护

LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning

模型训练强化学习奖励建模与过程监督RLVR

摘要

多视角空间推理要求视觉—语言模型跨图像比较视觉证据、对齐物体对应关系、并在长视觉上下文上推断空间关系——这一设定下思维链推理容易变得冗长却不见得更准确。带可验证奖励的强化学习天然适合该任务,但标准GRPO奖励依赖稀疏的结果级反馈,既不给出推理轨迹哪里出错的信号,也无法控制其长度。我们提出LenGuard-GPC,一个同时解决两个问题的稠密奖励框架:对每条采样轨迹,比较标准提示与引导提示下的逐token预测分布,把所得的token和KL散度用作稠密奖励信号。由于该KL惩罚随token累积、会不加区分地奖励更短回复,我们引入分阶段长度奖励,把推理长度保持在受控范围内而不只是鼓励简短。在六个多视角空间推理基准上,LenGuard-GPC相对原版GRPO提升准确率的同时降低平均回复长度。

LenGuard-GPC:面向空间推理强化学习的引导提示一致性长度守护:论文配图
图 1:用于多视图空间推理的 LenGuard-GPC 概述。在分阶段区间[l1,l2][l_{1},l_{2}]内,LenGuard-GPC自适应地平衡基于KL的负一致性奖励和长度奖励。当每个令牌的平均 KL 较高时,一致性奖励占主导地位并鼓励更简洁的推理。当每个标记的平均 KL 较低时,长度奖励变得相对较强,从而防止模型陷入过短和内容匮乏的思想链。