论文
视觉语言模型中物理推理的奖励设计
Reward Design for Physical Reasoning in Vision-Language Models
摘要
对视觉输入的物理推理要求视觉感知、领域知识与多步符号推理的紧密整合。然而即便最先进的视觉语言模型(VLM)在物理基准上也远逊于人类水平。尽管监督微调(SFT)与Group Relative Policy Optimization(GRPO)等后训练算法已在语言模型中展现出强大的推理增益,奖励设计如何塑造VLM的物理推理行为仍知之甚少。我们针对基于GRPO的VLM物理推理训练开展系统性的奖励消融研究。我们比较四种语义丰富度递增的奖励信号:格式合规、答案准确率、复合量规奖励(答案正确性、物理原理识别与单位一致性),以及一种由模型对输入图像区域的注意力权重导出的新颖内部奖励。我们在PhyX上评估,这是一个覆盖六个物理领域、六种推理类型、包含选择题与开放式两种形式的3,000题基准,使用IBM Granite Vision 3.3 (2B)。在两种形式下,采用基于准确率奖励的GRPO在多数领域优于SFT,但收益因奖励类型与领域而显著不同。奖励设计并不会均匀地提升性能。相反,它会诱发领域特定的推理行为。基于准确率的奖励提供最强的整体收益。量规奖励改善结构化推理质量,但准确率提升并不一致。基于注意力的奖励增强空间推理,却在符号领域降低性能。我们的内部注意力权重奖励无需空间标注,即把空间关系准确率从0.27提升至0.50,表明监督模型在生成过程中的注意力落点是视觉落地物理推理的一个有前景方向。
