论文
LenGuard-GPC:面向空间推理强化学习的引导提示一致性长度守护
LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning
摘要
多视角空间推理要求视觉—语言模型跨图像比较视觉证据、对齐物体对应关系、并在长视觉上下文上推断空间关系——这一设定下思维链推理容易变得冗长却不见得更准确。带可验证奖励的强化学习天然适合该任务,但标准GRPO奖励依赖稀疏的结果级反馈,既不给出推理轨迹哪里出错的信号,也无法控制其长度。我们提出LenGuard-GPC,一个同时解决两个问题的稠密奖励框架:对每条采样轨迹,比较标准提示与引导提示下的逐token预测分布,把所得的token和KL散度用作稠密奖励信号。由于该KL惩罚随token累积、会不加区分地奖励更短回复,我们引入分阶段长度奖励,把推理长度保持在受控范围内而不只是鼓励简短。在六个多视角空间推理基准上,LenGuard-GPC相对原版GRPO提升准确率的同时降低平均回复长度。
