论文
回顾:通过视觉参考使用在何处以及如何对 LVLM 响应进行评分
LookBack: Where and How to Score LVLM Responses via Visual Reference Usage
摘要
大视觉语言模型 (LVLM) 将视觉感知与语言生成相结合,从而实现跨越图像理解和复杂推理的响应。然而,LVLM 不仅仅继承了文本级的幻觉;它还继承了文本级的幻觉。他们还会对图像产生幻觉,产生不基于他们所看到的内容的流畅反应。这使得 LVLM 响应评分本质上更加困难,并且我们的诊断表明,LLM 采用的现有基于置信度的指标不足以满足 LVLM 的要求。具体来说,删除输入图像几乎不会改变基于置信度的选择,这表明输出空间置信度主要捕获文本的合理性而不是与图像的一致性。为了解决这一差距,我们提出了 LookBack,这是一种 无需训练 LVLM 响应评分方法,它通过视觉回溯评分来增强标记可能性,这是每个响应标记引用图像标记的强度的轻量级度量。在四个基准和三个模型中,LookBack 始终在现有基线上改进 Best-of$N$ 选择,而额外开销可以忽略不计。