论文
阅读房间,阅读图像:理解多模态视觉环境中的间接言语行为
Read the Room, Read the Image: Understanding Indirect Speech Acts in Multimodal Visual Contexts
摘要
间接言语行为(ISA)需要根据上下文进行实用推理,因为指令意图不能仅从表面形式推断出来。先前的基于文本的研究和现有的多模态基准在很大程度上忽视了这一要求,而是专注于显式编码的上下文或感知识别,因此没有充分探索依赖于上下文的语用理解,特别是在韩语等高上下文语言中。我们引入 READI,这是一个多模式基准,用于通过视觉上下文和对话的综合推理来评估 ISA 理解。 READI 基于语用理论对间接性进行分级,并将任务制定为基于视觉的语用问答(V-PQA),支持英语和韩语的跨语言评估。实验表明,即使是最先进的多模态模型也会与基于视觉的间接言语行为作斗争,随着间接性的增加,性能会下降,这强调了需要明确针对上下文语用推理的基准。