论文
PDCR:视觉语言推理的感知分解置信度奖励
PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning
摘要
具有可验证奖励的强化学习 (RLVR) 传统上依赖于稀疏的、基于结果的信号。最近的工作表明,提供细粒度的模型固有信号(奖励 真值 答案中的置信度增长)可以通过提供步骤级指导而无需昂贵的外部模型,从而有效地改善语言推理训练。虽然对单模态文本有效,但我们发现,天真地将这种全局奖励应用于视觉语言(V-L)推理是一种次优策略,因为该任务是稀疏视觉感知和密集文本推理的异构混合。这种全局标准化会造成混合引起的信号退化,其中视觉步骤的训练信号在统计上被主要的文本步骤扭曲。我们提出了感知分解置信奖励(PDCR),这是一个通过将奖励结构与任务的异构性质相结合来解决这个问题的框架。 PDCR 首先执行无监督技能分解,引入模型内部视觉依赖评分来量化视觉依赖,并应用聚类算法来分离感知和推理步骤。在此基础上,PDCR 通过标准化每个技能集群内的置信增益来计算分解优势。这种簇内标准化为感知和推理提供了稳定、正确缩放的信号。我们证明 PDCR 在关键的 V-L 推理基准上优于朴素的全局奖励公式和稀疏奖励基线。