论文

哪一个是香蕉人?评估多轮语用解释中的视觉语言模型

Which one is banana man? Evaluating vision-language models in multi-turn pragmatic interpretation

模型评测模型能力评测

摘要

对环境的灵活适应和共同的实用直觉有助于顺利的人类对话。迭代参考游戏——玩家使用语言反复挑选新的参考对象——为智能体在多轮语言环境中执行上下文相关的语用推理的能力提供了一个测试用例。我们测试了人类和视觉语言模型识别迭代参考游戏中产生的描述的预期含义的能力,并根据数量、顺序和相关性改变所提供的上下文。虽然人类始终表现良好,但我们评估的模型可以利用先前的上下文来解释人类的指代表达,但他们很难建立相关的上下文来有效地解释这些表达。我们的结果表明,我们评估的模型缺乏高效语言协作所需的核心技能。