论文

VCE:通过视觉对比编辑的 LVLM 零成本幻觉缓解方法

VCE: A zero-cost hallucination mitigation method of LVLMs via visual contrastive editing

模型训练模型编辑与遗忘

摘要

大型视觉语言模型 (LVLM) 经常遭受物体幻觉 (OH) 的困扰,其中它们生成的描述包含输入图像中实际不存在的物体。这种现象在医学成像和自动驾驶等现实应用中尤其成问题,因为这些应用的准确性至关重要。最近的研究表明,幻觉问题可能源于语言先验:在预训练期间学到的偏差导致 LVLM 根据统计共现生成单词。为了缓解这个问题,我们提出了视觉对比编辑(VCE),这是一种新颖的事后方法,通过分析模型对对比视觉扰动的响应来识别和抑制幻觉倾向。使用奇异值分解(SVD),我们分解模型的激活模式以隔离幻觉子空间并应用有针对性的参数编辑来减弱其影响。与需要 微调 或标记数据的现有方法不同,VCE 作为无标记干预运行,使其既可扩展又实用,适合在资源有限的环境中部署。实验结果表明,VCE 在多个基准测试中有效减少了物体幻觉,同时保持了模型原有的计算效率。