论文

歧义去了哪里?分析多模态模型如何理解多义词

Where did the ambiguity go? Examining how multimodal models interpret polysemous words

模型评测模型行为与机制分析

摘要

人类语言高度多义化。许多常见的词汇(例如bank或palm)携带多种不同的含义,这些含义塑造人类的交流和想象。大语言模型(LLMs)已被证明能够理解这种多义性,但关于多义性如何在其他模态(如图像)中表现的知识相对较少。我们对17个文生图模型和15个文本生成模型提供无上下文的多义词来研究这一现象,测量生成的句子和图像中的不同含义。我们发现一个明显的多模态差距,每个模型家族生成的图像倾向于产生更少的含义(归一化熵0.10 vs. 0.25),而两者都远少于人们想象的相同词汇的含义(归一化熵0.47)。然而,当我们将模型要求它列出每个可能含义的生成频率时,它预测的分布比实际生成的分布更加多样化。这些结果揭示了基础模型如何表达意义以及它们的理解是否忠实且平等跨模态。

歧义去了哪里?分析多模态模型如何理解多义词:论文配图
图1:将同一个没有上下文的多义词交给文生图模型(上)和人类(下),比较各自呈现的词义。对于 bolt,所有模型都只画出金属紧固件,而人类的回答分布于闪电、紧固件和冲刺等不同含义。文生图模型将多义词压缩为单一主导意义,人类则保留其歧义。