论文

认知枢轴点与视觉锚定:揭示并矫正多模态推理模型中的幻觉

Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models

模型训练强化学习RLVR

摘要

多模态大型推理模型(MLRM)通过测试时计算扩展在视觉推理上取得显著进展,但长链推理仍易产生幻觉。我们识别出一种值得警惕的现象,称为推理-视觉-真值脱节(Reasoning Vision Truth Disconnect, RVTD):幻觉与常表现出高熵状态的认知分叉点强相关。我们将这种脆弱性归因于视觉语义锚定的失效,定位于网络的中间层;具体而言,在这些高不确定性转换期间,模型未能查询视觉证据,转而退回语言先验。因此,我们主张从单纯的结果级监督转向辅以细粒度的内部注意力引导。为此,我们提出V-STAR(Visual Structural Training with Attention Reinforcement),一个旨在将视觉觉知推理能力内化的轻量级整体训练范式。我们方法的核心是集成于GRPO框架内的分层视觉注意力奖励(Hierarchical Visual Attention Reward, HVAR)。在检测到高熵状态时,该机制动态激励关键中间层的视觉注意力,从而将推理过程重新锚定到视觉输入。此外,我们提出强制反思机制(Forced Reflection Mechanism, FRM),一种轨迹编辑策略,通过在高熵认知分叉点附近触发反思并鼓励对照视觉输入验证后续步骤来打破认知惯性,从而将外部去偏干预转化为缓解幻觉的内在能力。

认知枢轴点与视觉锚定:揭示并矫正多模态推理模型中的幻觉:论文配图
图8:V-STAR总体框架。我们的范式在 GRPO 框架内统一了微观注意力引导和宏观轨迹编辑。 [32] (左)强制反射机制(FRM):一种轨迹编辑策略,通过插入触发令牌来激活检测到的高熵认知分叉点周围的反射循环。这将反思集中在关键过渡区域,鼓励更新视觉基础,破坏认知惯性,并将自我纠正行为内化。 (中)分层视觉注意力奖励(HVAR):一种奖励机制,在检测到高熵认知分叉点时,激励中间层(第11至20层)的视觉语义锚定,从而修复视觉沉默。 (右)基于 GRPO 的优化:复合奖励集成了结果正确性、视觉注意力奖励和反射格式奖励,以用 GRPO 更新策略。