论文
在大型视觉语言模型中桥接视觉表示和可验证奖励的强化学习
Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models
摘要
可验证奖励的强化学习(RLVR)大幅增强了 大语言模型 在抽象推理任务中的推理能力。然而,它在大型视觉语言模型(LVLM)中的应用仍然受到结构表征瓶颈的限制。现有方法普遍缺乏对视觉信息的显式建模和有效利用,阻碍了视觉表示与强化学习优化过程的紧密结合,从而限制了多模态推理性能的进一步提高。为了解决这个限制,我们提出了 KAWHI(关键区域对齐加权谐波激励),这是一种即插即用的奖励重新加权机制,它将结构化视觉信息明确地纳入统一的奖励策略优化方法(例如 GRPO 和 GSPO)中。该方法通过分层几何聚合自适应地定位语义显着区域,通过结构化归因识别视觉关键注意力头,并执行段落级信用重新分配,以将空间视觉证据与语义决定性推理步骤对齐。对不同推理基准的广泛实证评估证实 KAWHI 作为通用增强模块,持续改进各种统一奖励优化方法的性能。项目页面:KAWHI (https://kawhiiiileo.github.io/KAWHI_PAGE/)