论文

伪统一:熵探测揭示统一多模态模型中的不同信息模式

Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models

模型评测模型行为与机制分析

摘要

统一多模态模型(UMM)旨在将大语言模型(LLM)的推理能力与视觉模型的生成能力相结合。然而,在实践中,这种协同作用仍然难以捉摸:UMM 无法将类似 LLM 的推理转移到图像合成,并表现出不同的响应行为。我们将这种现象称为伪统一。诊断其内部原因很重要,但现有的探测方法要么缺乏模型内部的洞察力,要么忽略提示响应依赖性。为了解决这些限制,我们提出了一个信息论探测框架,该框架联合分析 UMM 如何编码输入并生成输出。应用于十个代表性的UMM,我们的框架揭示了伪统一源于双重分歧:(i)模态非对称编码,其中视觉和语言遵循不同的熵轨迹,以及(ii)模式分裂响应,其中文本生成表现出高熵创造力,而图像合成则强制执行低熵保真度。只有统一双方的模型(例如,通过上下文预测)才能实现更真正的统一,即使参数较少,也能实现更强大的基于推理的文本到图像生成。我们的工作提供了第一个统一模型内部探索,证​​明真正的多模式协同需要信息流的一致性,而不仅仅是共享参数。