论文

统一的多模式模型是否在一个空间中思考?通过跨分支转向的镜头

Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering

模型评测模型行为与机制分析

摘要

统一多模态模型(UMM)旨在将理​​解和生成集成在单一架构中,但目前尚不清楚这些功能是否共享统一且可转移的语义空间。这个问题从根本上来说是具有挑战性的,因为这两个分支在异构表示(文本标记与视觉潜伏)和不同的训练目标上运行,使得直接比较变得困难。为了解决这个问题,我们引入了 \emph{跨分支语义转向},这是一种基于干预的框架,可以从一个分支中提取语义方向并将其应用于另一个分支。我们表明,从理解分支学习到的引导向量可以转移到生成,从而实现可控的图像合成和改进的语义 忠实性。相比之下,相反的方向始终显示出有限的效果。我们的分析表明,这种不对称可能与实际的表征不匹配有关:理解派生的向量捕获可转移的、以对象为中心的语义,而生成派生的向量主要编码底层外观特征。我们的结果表明,架构统一并不能保证语义对齐,并将跨分支引导建立为探索多模态表示的实用工具。