论文
相同证据、不同判断:视觉/语音-文本冲突中的证据不可交换性
Same evidence, different judgments: Evidence noncommutative in vision/speech-text conflicts
摘要
对多模态大语言模型而言,当图像或语音与伴随文本冲突时,测得的文本依赖可能把模态偏好与证据位置纠缠在一起。此前关于文本偏差的研究往往使用固定的证据顺序,或让任务指令随证据一起移动,使顺序的贡献不够清晰。本文采用一种配对比较:保持指令与证据内容固定,仅交换两个信息源的位置,以量化这一潜在影响。在视觉与语音模型上,把图像或录音放在冲突文本之后,会一致地使答案偏向该信息源的内容。我们还重新审视了既往研究,分析其实验设定为何可能导致误导性结论。这些发现揭示了跨模态证据的不可交换性(noncommutativity):同样的证据在顺序改变时会导致不同的判断,而把感知证据放在后面会增加模型对其内容的依赖。
