论文
多模态情境下句子可接受度判断的预测
Predicting Sentence Acceptability Judgments in Multimodal Contexts
摘要
以往工作考察了深度神经网络(DNN),尤其是 transformer,预测人类句子可接受度判断的能力,既包括脱离上下文的情形,也包括文档上下文中的情形。我们考察先接触视觉图像(即视觉上下文)对人类与大语言模型(LLM)这些判断的影响。我们的结果表明,与文本上下文不同,视觉图像对人类可接受度评分几乎没有影响。然而,LLM 表现出以往工作在文档上下文的人类判断中观察到的压缩效应。不同类型的 LLM 都能以较高准确度预测人类可接受度判断,但总体上,去掉视觉上下文后其表现略好。此外,LLM 判断的分布在模型间存在差异:Qwen 接近人类模式,其他模型则与之偏离。一般而言,LLM 对句子可接受度的预测与其归一化对数概率高度相关,但当视觉上下文存在时相关性下降,表明存在视觉上下文时 LLM 内部表征与其生成预测之间的差距更大。我们的实验揭示了人类与 LLM 在多模态情境中处理句子的相似与差异之处。