论文
超越文本主导:理解全模态大语言模型的模态偏好
Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models
摘要
原生全模态大语言模型(OLLM)已从流水线架构转向统一表示空间。然而,这种原生集成催生了一个关键却未被充分研究的现象:模态偏好。为填补这一空白,我们首先利用新构建的基于冲突的基准和模态选择率指标,系统量化OLLM的模态偏好。对十个代表性OLLM的评估揭示了一个显著的范式转变:与传统VLM的“文本主导”不同,大多数OLLM表现出明显的视觉偏好。为进一步理解其内在机制,我们进行逐层探测,证明这种模态偏好并非静态,而是在中后层逐渐显现。基于这些发现,我们利用这些内部信号诊断跨模态幻觉,在无需任务特定数据的情况下,于三个下游多模态基准上取得有竞争力的表现。我们的工作为构建更可信的OLLM提供了机制理解和实用工具。我们的代码与相关资源已公开于:https://github.com/icip-cas/OmniPreference
