论文

大视觉语言模型中减轻幻觉的风险意识选择性提示

Risk-aware Selective Prompting for Hallucination Mitigation in Large Vision-Language Models

模型推理推理验证与自校正

摘要

基于提示的验证被广泛用于减轻大型视觉语言模型 (LVLM) 中的幻觉,但它何时起作用仍然知之甚少。我们系统地研究了两个具有代表性的 LVLM 架构和幻觉基准的验证提示,发现它是一种有风险的干预措施:它的修正随着输入难度的增加而增加,而新引入的错误在不同难度级别上仍然存在。因此,始终在线的提示有助于硬输入,但对较简单的输入几乎没有好处,甚至可能有害。我们的分析进一步表明,这种行为与保守的产出变化有关。验证提示将注意力从视觉标记重新分配到指令标记,并诱导中性提示控制中不存在的明显的中层熵模式,这表明指令条件性注意力重新分配,而不是统一改善视觉基础。受这种依赖于输入的风险的推动,我们提出了风险意识选择性提示(RSP),这是一种 无需训练 方法,它使用预生成的不确定性信号来选择性地触发验证。 RSP 减轻了始终在线提示的退化,同时保留了基线性能,并揭示了有效选择信号因架构而异。