论文

MIRAGE:视觉理解的幻象

Mirage The Illusion of Visual Understanding

模型评测模型行为与机制分析

摘要

多模态AI系统在广泛的现实任务中取得了出色表现,但其视觉-语言推理背后的机制仍然令人惊讶地缺乏理解。我们报告三项发现,它们挑战了关于这些系统如何处理与整合视觉信息的流行假设。其一,前沿模型会针对从未提供的图像轻松生成详细的图像描述与精细的推理轨迹,包括偏向病理的临床发现;我们将这一现象称为海市蜃楼式推理(mirage reasoning)。其二,在没有任何图像输入的情况下,模型在通用与医学多模态基准上也能取得惊人的高分,这使这些基准的效用与设计受到质疑。在最极端的案例中,我们的模型在无法访问任何图像的情况下,在一个标准胸部X光问答基准上取得了第一名。其三,当模型被明确指示在无法访问图像的情况下猜测答案,而不是被隐式提示假定图像存在时,性能显著下降。显式猜测似乎启用了一种更保守的响应模式,与之相对的是海市蜃楼模式——模型表现得仿佛图像已被提供。这些发现揭示了视觉-语言模型在推理与评估方式上的根本脆弱性,表明迫切需要能消除使非视觉推理成为可能的文本线索的私有基准,尤其是在AI失准后果最严重的医学场景中。我们提出B-Clean,作为对多模态AI系统进行公平、以视觉为依据的评估的一种有原则的解决方案。

MIRAGE:视觉理解的幻象:论文配图
图 1:海市蜃楼效应的定义和量化。 a,我们将海市蜃楼定义为在没有任何图像输入的情况下描述视觉特征的人工智能模型。孤立地看,受海市蜃楼效应影响的模型的输出与正常视觉推理的输出没有区别。它们都描述了所看到的图像和视觉特征,没有表现出任何不确定的迹象。 b,我们通过测量模型显示给定类别中所有问题的效果的频率来量化多模态人工智能模型中的海市蜃楼效应。这些问题旨在专门询问该类别中常见的图像输入,而不提供任何图像。 c,我们在所有测试的 AI 模型中始终表现出较高的海市蜃楼效应表现率。我们观察到,与旧模型相比,一种模型的最新版本的平均比率可能更高,这表明持续训练和获取新技能可能会导致多模态环境中出现不良行为。