论文

大视觉语言模型中的测试时幻觉控制

Test-Time Hallucination Control in Large Vision-Language Models

模型推理解码与生成控制

摘要

大型视觉语言模型(LVLM)中的物体幻觉(其中模型生成有关输入图像的非事实内容)仍然是其在现实应用中可靠性的关键障碍。现有的缓解策略可以分为基于训练的方法和无需训练方法。基于训练的方法通常可以获得很强的性能,但成本高昂,需要大量的计算资源、大规模数据和耗时的 微调。 无需训练 方法因其效率而特别有吸引力。然而,现有的 无需训练 方法要么需要多轮解码,这会增加计算开销,要么以特定于模型的方式修改内部状态,这可能会降低预训练知识的质量。我们提出了测试时幻觉缓解(TTH)方法,这是一种解决这两个限制的新颖的 无需训练 方法。 TTH 引入了一个词元验证器模块,以零样本多模态分类器 (MMC) 的形式实现,以生成基于输入图像的辅助 logits。这些 logits 与 词元级 处的原始 LVLM 输出融合,用于从候选池中选择的对象词元。然后应用基于熵的加权方案来实现稳健且准确的预测。跨多个 LVLM 系列和不同基准的广泛实验表明,TTH 持续提高准确性和鲁棒性,强调其普遍性和实际有效性。代码发布于 https://github.com/Mehran-TAM/TTH