论文
ClipTTT:CLIP 引导的测试时训练帮助 LVLM 看得更清楚
ClipTTT: CLIP-Guided Test-Time Training Helps LVLMs See Better
摘要
大型视觉语言模型(LVLM)容易产生幻觉,尤其是当视觉输入在测试时被破坏时。我们表明,这种腐败行为会导致额外的分布变化,从而显着放大现实世界应用中的幻觉率。为了解决这个问题,我们提出了 CLIP 引导的测试时间训练 (ClipTTT),这是一种在退化条件下使用单个测试样本动态调整 LVLM 的方法。具体来说,我们利用预训练 CLIP 模型的图像文本对齐强度作为稳定的指导信号来识别可靠的自我监督目标,从而在不改变基本 LVLM 的情况下实现快速适应。对标准幻觉基准(具有 15 种常见损坏)的大量实验表明,ClipTTT 可以有效减轻幻觉并改进视觉损坏下的描述性 忠实性。