论文

当不相关文本很重要时:多模式 大语言模型 中的仿射边距变化

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

模型评测模型行为与机制分析

摘要

多模态 大语言模型 (MLLM) 经常接触辅助文本上下文,其对视觉基础任务的影响仍未得到充分探索。在本文中,我们通过将与任务无关的上下文表述为二元视觉判断框架内的受控干预来研究其影响。通过在改变辅助输入的同时保持不变的提示结构,我们观察到不相关的文本在不同的基准上一致地使模型预测产生偏差。为了超越性能指标,我们通过由二进制候选之间的对数概率差异定义的决策裕度来描述这种敏感性。我们的分析揭示了强大的几何规律:上下文条件边距遵循上下文无关边距的一致仿射变换。这一发现表明,不相关的上下文并不表现为非结构化随机噪声,而是表现为模型偏好的可估计失真。我们进一步将拟合的仿射参数解释为视觉承诺保留和方向答案偏差的指标。这些发现提供了 MLLM 中不相关上下文效应的边际水平诊断视图,并为未来的噪声上下文鲁棒性研究提供了基础