论文
SeeMe:通过有效的视觉标记工程减轻大视觉语言模型中的幻觉
SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering
摘要
大视觉语言模型(LVLM)在图像字幕和视觉问答等视觉理解任务中取得了显着的进步。然而,它们仍然容易产生幻觉,产生与实际视觉输入不一致的内容。现有的方法主要在解码阶段进行干预,而忽略了幻觉的关键来源:误导解码过程的不相关或嘈杂的视觉标记。为了解决这个问题,我们提出了 SeeMe,一个 无需训练 框架,它将特征工程的概念从传统机器学习引入到 LVLM 中。 SeeMe 通过三阶段词元工程流程重组视觉词元,以抑制幻觉源,同时保留信息丰富的视觉证据。对四个 LVLM 的 MME、POPE 和 AMBER 基准进行的实验表明,SeeMe 持续减少幻觉并提高输出一致性,为减轻 LVLM 中的幻觉提供了新的视角。