论文

弃权之前再看一遍:可靠视觉语言模型的预算保形证据获取

Look Again Before You Abstain:Budgeted Conformal Evidence Acquisition for Reliable Vision-Language Model

模型推理推理验证与自校正

摘要

大型视觉语言模型 (LVLM) 产生幻觉:它们断言图像不支持的视觉细节。一个原则性的补救措施是采用无分配保证的选择性预测——验证每个主张,并在该主张不成立时弃权,以便所主张的主张中的幻觉率可证明是有界的。然而,我们表明,这种保证是以残酷的代价购买的:为了在平衡的物体存在基准上将幻觉率保持在 5\%$ 以下,最先进的保形滤波器必须放弃超过 80\%$ 的声明。我们认为,当更多视觉证据廉价可用时,弃权是一种浪费,并引入预算保形证据获取(BCEA),它用三向选择取代二元答案/弃权决策:回答、弃权或通过在有界的情况下重新检查图像(缩放、裁剪或应用特定于声明的干预)来获取额外的视觉证据。