论文

超越文本主导:理解全模态大语言模型的模态偏好

Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models

模型评测模型行为与机制分析

摘要

原生全模态大语言模型(OLLM)已从流水线架构转向统一表示空间。然而,这种原生集成催生了一个关键却未被充分研究的现象:模态偏好。为填补这一空白,我们首先利用新构建的基于冲突的基准和模态选择率指标,系统量化OLLM的模态偏好。对十个代表性OLLM的评估揭示了一个显著的范式转变:与传统VLM的“文本主导”不同,大多数OLLM表现出明显的视觉偏好。为进一步理解其内在机制,我们进行逐层探测,证明这种模态偏好并非静态,而是在中后层逐渐显现。基于这些发现,我们利用这些内部信号诊断跨模态幻觉,在无需任务特定数据的情况下,于三个下游多模态基准上取得有竞争力的表现。我们的工作为构建更可信的OLLM提供了机制理解和实用工具。我们的代码与相关资源已公开于:https://github.com/icip-cas/OmniPreference

超越文本主导:理解全模态大语言模型的模态偏好:论文配图
图 1:三模式冲突输入示例的图示。文本、图像和音频模态传达了相互矛盾的语义,OLLM 选择与图像模态一致的答案,揭示了视觉模态偏好。