论文

用于视觉推理的感知流网络

Perceptual Flow Network for Visually Grounded Reasoning

模型训练强化学习

摘要

尽管大视觉语言模型(LVLM)取得了成功,但一般优化目标(例如标准 MLE)无法约束视觉轨迹,从而导致语言偏差和幻觉。为了缓解这种情况,当前的方法引入了视觉专家的几何先验作为额外的监督。然而,我们观察到这种监督通常不是最理想的:它偏向于几何精度并且提供有限的推理效用。为了弥补这一差距,我们提出了感知流网络(PFlowNet),它避免了与专家先验的严格对齐,并实现了可解释但更有效的视觉推理。具体来说,PFlowNet 将感知与推理解耦,建立一个自调节的生成过程。在此基础上,它通过变分强化学习将多维奖励与邻近几何形状相结合,从而促进面向推理的感知行为,同时保持视觉可靠性。 PFlowNet 提供了可证明的性能保证和具有竞争力的实证结果,特别是在 V* Bench (90.6%) 和 MME-RealWorld-lite (67.0%) 上创下了新的 SOTA 记录。