论文
双流交叉锚点校正使长篇图像描述与证据一致和对象级锚点的域限制
Dual-Stream Cross-Anchor Correction Grounding Long-Form Captions and the Domain Limits of Object-Level Anchors
摘要
当语言先验和语料库共现偏差超过视觉证据,并且没有任何物体提及与图像联系时,多模态 大语言模型 中的物体幻觉就会出现。大多数补救措施在解码时进行干预,但在统一协议下,它们的好处仅限于短图像描述;在细节丰富的语料库上进行监督的 微调 (SFT) 延长了图像描述,但超过 40% 的内容仍然命名了缺失的对象。本文提出双流交叉锚校正(DSCC)。与后处理解码的工作不同,DSCC 在 微调 期间将对象级视觉锚点注入到语言模型本身中:感知流通过双向对比目标将中间层的对象级隐藏状态与冻结文本锚点对齐;认知流让更深的层通过在每个生成步骤中的交叉注意力来查询这些锚点;两阶段的课程门将它们耦合起来,使证据检索成为对生成的结构性约束。在一个主干和一个评分协议下,实验涵盖长图像描述幻觉、对象存在辨别和跨域泛化,并在同一语料库和时间表上使用普通 SFT 作为长度和密度匹配的控制,将数据效果与架构增益分开。 DSCC 单独达到了长图像描述、低幻觉区域:图像描述大约是基线长度的 1.9 倍,每个对象提及的精度为 88.19%,这是密度无关标准下的最高精度。消融揭示了协同作用:单独的感知流会降低精度,但当叠加在认知流上时会反转符号。没有声称具有普遍的优越性:三个域外基准产生了可预测的、可证伪的域条件,协同作用与锚点的语义域绑定在一起,并在图表和视觉错觉上失效。