论文
使用以感知为中心的过程奖励模型改进视觉语言模型
Improving Vision-language Models with Perception-centric Process Reward Models
摘要
具有可验证奖励的强化学习(RLVR)的最新进展显着提高了视觉语言模型(VLM)的复杂推理能力。然而,其结果级监督过于粗略,无法诊断和纠正推理链中的错误。为此,我们提出了 Perceval,一种能够实现 词元级 错误定位的过程奖励模型(PRM),它可以从响应中提取与图像相关的主张,并将其与图像中的视觉证据一一进行比较,最终返回包含感知错误的主张。 Perceval 使用感知密集型监督训练数据进行训练。然后,我们将 Perceval 集成到 RL 训练过程中来训练策略模型。具体来说,与应用序列级优势的传统 GRPO 相比,我们通过针对 Perceval 识别的幻觉跨度进行惩罚来应用 词元级 优势,从而实现细粒度的监督信号。除了增强训练过程之外,Perceval 还可以在推理阶段协助 VLM。使用 Perceval,我们可以截断模型响应的错误部分,然后让模型直接重新生成响应或诱导模型反映其先前的输出。该过程可以重复多次以实现测试时间缩放。实验表明,经过 RL 训练的多个推理 VLM 的各个领域的基准都得到了显着改进,凸显了以感知为中心的监督作为通用策略的前景。对于测试时间扩展,它还表现出比主要投票等其他策略一致的性能增益。我们的代码和数据将在 https://github.com/RUCAIBox/Perceval 公开发布。