论文
认知枢轴点与视觉锚定:揭示并矫正多模态推理模型中的幻觉
Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models
摘要
多模态大型推理模型(MLRM)通过测试时计算扩展在视觉推理上取得显著进展,但长链推理仍易产生幻觉。我们识别出一种值得警惕的现象,称为推理-视觉-真值脱节(Reasoning Vision Truth Disconnect, RVTD):幻觉与常表现出高熵状态的认知分叉点强相关。我们将这种脆弱性归因于视觉语义锚定的失效,定位于网络的中间层;具体而言,在这些高不确定性转换期间,模型未能查询视觉证据,转而退回语言先验。因此,我们主张从单纯的结果级监督转向辅以细粒度的内部注意力引导。为此,我们提出V-STAR(Visual Structural Training with Attention Reinforcement),一个旨在将视觉觉知推理能力内化的轻量级整体训练范式。我们方法的核心是集成于GRPO框架内的分层视觉注意力奖励(Hierarchical Visual Attention Reward, HVAR)。在检测到高熵状态时,该机制动态激励关键中间层的视觉注意力,从而将推理过程重新锚定到视觉输入。此外,我们提出强制反思机制(Forced Reflection Mechanism, FRM),一种轨迹编辑策略,通过在高熵认知分叉点附近触发反思并鼓励对照视觉输入验证后续步骤来打破认知惯性,从而将外部去偏干预转化为缓解幻觉的内在能力。
