论文
MLLM中依赖架构的融合通路
Architecture-Dependent Fusion Pathways in MLLMs
摘要
多模态大语言模型(MLLM)跨视觉语言任务表现强劲,但视觉与文本信息跨层融合的内部机制仍不充分了解。我们研究两种架构范式的代表性MLLM:拼接架构与原生多模态架构。我们进行三个渐次关联的分析:对齐解耦识别哪个模态变化,注意力路由与熵刻画跨模态信息如何分布,内在维度考察融合如何重塑特征空间;另行执行因果干预实验验证所得解释;补充分析用视觉CKA考察柏拉图表示假说。分析共同揭示两条不同的融合通路:拼接模型遵循先文后视的通路,而原生模型表现出更早的视文共适应与特征空间重组。本工作为理解多模态融合提供机制视角,支持面向架构的多模态表示诊断。