论文
CFPO:多模态推理的反事实策略优化
CFPO: Counterfactual Policy Optimization for Multimodal Reasoning
摘要
大型视觉语言模型(LVLM)在多模态推理方面表现出了卓越的能力。然而,流行的强化学习(RL)范式缺乏明确的反事实增强和因果学习机制。这种根本性的缺陷会导致严重的基础失败,表现为倾向于忽视有利于语言先验的视觉证据,或者在长链思维推理过程中表现出幻觉漂移。为了解决这个根本原因,我们提出了 CounterFactual 策略优化(CFPO),这是一种新的框架,可以强制视觉感知和文本推理之间的因果一致性。 CFPO 引入了跨模式反事实增强机制,该机制通过最大化模型预测与关键视觉线索被抑制的反事实状态之间的差异来规范策略。这种方法与 GRPO 和 DAPO 等标准算法无缝集成,无需外部奖励模型或额外的监督。大量实验表明,CFPO 显着提高了推理保真度,比标准 RL 基线实现了 3.17%-6.25% 的一致增益,比最先进的感知感知方法 (PAPO) 实现了 1.32%-2.13% 的一致增益。代码可在 https://github.com/Raven-July/CFPO 获取。