论文

并非所有token都同等地“看见”:面向大型视觉语言模型的感知锚定策略优化

Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models

模型训练强化学习RLVR

摘要

尽管可验证奖励强化学习(RLVR)推动了大视觉语言模型(LVLM)的推理能力,主流框架却存在一个根本性的方法缺陷:将相同的优势分配给所有生成的token,这天然稀释了对多模态推理中关键的、以视觉为依据的步骤进行优化所必需的学习信号。为弥合这一差距,我们提出token视觉依赖度(Token Visual Dependency)的形式化,通过视觉条件分布与纯文本预测分布之间的Kullback-Leibler(KL)散度量化视觉输入的因果信息增益。在揭示这种依赖高度稀疏且在语义上至关重要之后,我们提出感知锚定策略优化(PGPO),一个在token级动态重塑优势的新型细粒度贡献归因框架。通过阈值门控、质量守恒的机制,PGPO主动放大视觉依赖token的学习信号,同时抑制来自语言先验的梯度噪声。基于Qwen2.5-VL系列在七个富有挑战性的多模态推理基准上的大量实验表明,PGPO平均使模型提升18.7%。理论与实证分析均证实,PGPO有效降低梯度方差、防止训练崩溃,并作为强正则化器促成稳健的、以感知为依据的多模态推理。代码将发布于https://github.com/Yzk1114/PGPO。

并非所有token都同等地“看见”:面向大型视觉语言模型的感知锚定策略优化
图 1:与标准统一信用分配不同,我们提出的方法将更高的强化学习优势动态分配给严重依赖视觉感知的关键标记。