论文
TruthLens:通过 LVLM 中自我评估真实性分数进行物体幻觉检测
TruthLens: Object Hallucination Detection via Self-Evaluating Truthfulness Scores in LVLMs
摘要
尽管大型视觉语言模型(LVLM)取得了显着进展,但物体幻觉仍然是阻碍其值得信赖的部署的基本挑战。一个关键的发现激励了我们的工作:真实的和幻觉的对象标记在隐藏表示中明显是可分离的,但这种可分离性在语言建模(LM)头部很大程度上丢失了。我们提出了 TruthLens,这是一个自我评估框架,可以教会 LM 头部暴露每个对象的真实性信号,而无需任何辅助模型或额外的推理成本。具体来说,一个很少使用的特殊词元被重新用作参考词元。对于每个对象标记位置,我们提取 LM 头分配给该特殊标记的对数概率,并将其与预定义常量的差异定义为真实性分数。然后使用 MSE 目标对模型进行微调,使真实物体的分数趋向 1,幻觉物体的分数趋向 0,同时发散约束保留原始生成能力。尽管只接受了有限的一组对象类别的训练,但 TruthLens 可以有效地推广到具有更大标签空间的基准。跨多个 LVLM 的广泛实验证明了最先进的性能;值得注意的是,在 Qwen2.5-VL-7B 上,TruthLens 在 AUROC 中的性能比之前在 MS-COCO 上的最佳方法高出 17% 以上。我们的代码可在 https://github.com/wyqstan/TruthLens 获取。