论文
YARD:Y 架构寄存器解码可有效减轻大视觉语言模型中的幻觉
YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models
摘要
对比解码(CD)旨在通过对比标准模型和视觉退化模型的输出分布来减轻大视觉语言模型(LVLM)中的幻觉。然而,现有的 无需训练 CD 方法遭受次优降级分支的困扰:完全丢弃视觉标记过于极端,会引发语言幻觉,而损坏的输入图像提供了对视觉证据的粗略控制,并且由于需要两次完整的前向传递而遭受高推理延迟。为了解决这些困境,我们提出了 YARD,一个 无需训练 Y 架构寄存器解码框架。受到可靠的文本到视觉基础主要出现在中间解码器层的观察的启发,YARD 通过共享浅层计算并准确地在这个关键阶段进行分支来在内部构造降级分支。对于降级分支,YARD 用寄存器标记替换补丁级视觉标记,这保留了全局图像语义,但缺乏细粒度的本地证据。这种图像感知但局部视觉证据关联的设计提供了忠实的对比信号,而不会出现极端的模态不匹配,而 Y 架构严格避免了昂贵的第二次前向传递。对生成性和判别性幻觉基准的大量实验表明,YARD 在多个 LVLM 上始终如一地实现了最先进的幻觉缓解,同时显着减少了推理延迟。