论文

调控多模态AI幻觉的可验证性

Steering the Verifiability of Multimodal AI Hallucinations

模型推理解码与生成控制

摘要

由多模态大语言模型(MLLM)驱动的AI应用容易产生幻觉,并对人类用户构成相当大的风险。关键在于,这类幻觉的问题程度并不相同:一些幻觉内容能被人类用户察觉(即显性幻觉),另一些则常被忽略或需要更多验证工夫(即隐性幻觉)。这表明多模态AI幻觉在可验证性上差异显著。然而,很少有研究探讨如何为具有不同安全性与易用性需求的AI应用控制这一属性。为填补这一空白,我们基于4,470条人类对AI生成幻觉的响应构建了一个数据集,并根据人类用户的可验证性将这些幻觉分为显性与隐性两类。此外,我们提出一种激活空间干预方法,为显性和隐性幻觉分别学习探针。我们发现显性与隐性幻觉会引出不同的干预探针,从而可以对模型的可验证性进行细粒度控制。实证结果证明了该方法的有效性,并表明针对性干预在调节相应可验证性方面表现更优。此外,只需混合这些干预即可灵活控制不同场景所需的可验证性。

调控多模态AI幻觉的可验证性:论文配图
图1:幻觉可验证性示意:同一图文对可产生显而易见(易验证)或隐晦难察(难验证)的两类幻觉。