论文

RS-HyRe-R1:一种克服遥感图像理解感知惯性的混合奖励机制

RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

模型训练奖励建模与过程监督

摘要

强化学习 (RL) 后训练 极大地改进了遥感视觉语言模型 (RS-VLM)。然而,在处理需要详尽视觉扫描的复杂遥感图像 (RSI) 时,模型往往依赖局部显着线索进行快速推理。我们将这种强化学习引起的偏差称为“知觉惯性”。在奖励最大化的驱动下,模型倾向于快速拟合结果,从而导致两个局限性:认知上,过度依赖特定特征会阻碍完整的证据构建;在操作上,模型很难灵活地跨任务转移视觉焦点。为了解决这种偏见并鼓励全面的视觉证据挖掘,我们提出了 RS-HyRe-R1,这是一种用于理解 RSI 的混合奖励框架。它引入了:(1)强制结构化视觉推理的空间推理激活奖励; (2) 感知正确性奖励,提供跨 RS 任务的自适应质量锚,确保准确的几何和语义对齐; (3)视觉语义路径进化奖励,惩罚重复推理并促进探索互补线索以建立更丰富的证据链。实验表明,RS-HyRe-R1 有效减轻了“知觉惯性”,鼓励更深入、更多样化的推理。仅使用 3B 参数,它就在 REC、OVD 和 VQA 任务上实现了最先进的性能,优于高达 7B 参数的模型。它还表现出强大的零样本泛化能力,在 VQA、OVD 和 REC 上分别超过第二好的模型 3.16%、3.97% 和 2.72%。代码和数据集可在 https://github.com/geox-lab/RS-HyRe-R1 获取。