论文

第一个 logits Boosting:减轻大型视觉语言模型中物体幻觉的视觉基础方法

First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models

模型推理解码与生成控制

摘要

最近的大型视觉语言模型(LVLM)在需要理解视觉和语言输入的各种多模态任务中表现出了卓越的性能。然而,物体幻觉——在答案中生成不存在的物体——仍然是一个持续存在的挑战。尽管已经提出了几种方法(例如再训练和外部证据核验方法)来缓解这个问题,但它们仍然面临高数据成本或结构复杂性的问题。 无需训练 方法(例如对比解码(CD))更具成本效益,避免了额外的训练或外部模型,但仍然遭受长期衰退的影响,随着生成的进展,视觉基础减弱,语言先验占主导地位。在本文中,我们提出了 First logits Boosting (FLB),这是一种简单而有效的 无需训练 技术,旨在减轻 LVLM 的长期衰减。 FLB 存储第一个生成的 token 的 logits 并将其添加到后续 token 预测中,有效减轻视觉信息的长期衰减。我们观察到 FLB (1) 在整个生成过程中维持第一个标记中嵌入的视觉信息,(2) 通过“The”标记的稳定作用抑制幻觉词。实验结果表明,FLB 显着减少了各种任务、基准测试和骨干模型的物体幻觉。值得注意的是,它造成的推理开销可以忽略不计,使其非常适用于实时多模式系统。代码可在 https://github.com/jiwooha20/FLB 获取