论文
歧义去了哪里?分析多模态模型如何理解多义词
Where did the ambiguity go? Examining how multimodal models interpret polysemous words
摘要
人类语言高度多义化。许多常见的词汇(例如bank或palm)携带多种不同的含义,这些含义塑造人类的交流和想象。大语言模型(LLMs)已被证明能够理解这种多义性,但关于多义性如何在其他模态(如图像)中表现的知识相对较少。我们对17个文生图模型和15个文本生成模型提供无上下文的多义词来研究这一现象,测量生成的句子和图像中的不同含义。我们发现一个明显的多模态差距,每个模型家族生成的图像倾向于产生更少的含义(归一化熵0.10 vs. 0.25),而两者都远少于人们想象的相同词汇的含义(归一化熵0.47)。然而,当我们将模型要求它列出每个可能含义的生成频率时,它预测的分布比实际生成的分布更加多样化。这些结果揭示了基础模型如何表达意义以及它们的理解是否忠实且平等跨模态。
