论文

新概念必须进入的地方:统一多模式模型中跨任务可用性的入口点

Where a New Concept Must Enter: Entry Point Gates Cross-Task Usability in Unified Multimodal Models

模型评测模型行为与机制分析

摘要

统一多模态模型(UMM)的动机是希望理解和生成能够相互加强,但受控消融反复发现,添加生成目标会使理解变得平淡。联合训练研究无法解决分歧:在重叠监督的情况下,收益不能归因于架构而不是数据。为了进一步研究 UMM 中两个方向之间的关系,我们通过构造将它们分开。一种新颖的视觉实体,一种渲染的 3D 资产,与一个经过筛选以排除冻结模型行为中的伪词配对,仅通过一个任务方向进行绑定,然后测量未经训练的方向。我们发现通道在两个方向上都是真实的,但方向不同:生成训练安装了一个模型只能在候选者之间匹配的名称;了解训练安装它也可以生产。控制跨任务可用性的是绑定进入共享计算的位置。对齐探针预测 36 种配置的导出 (Spearman $ρ= +0.68$)。该目标的对齐项在每个权重冻结的激活上以闭合形式最大化,使得在 28 层中的第 7 层注入时概念可绘制,并且与第 14 层以上的基本模型无法区分,而相同编辑的基于权重的版本在第 10-14 层达到峰值。在四个模型的观察系列中,此窗口仅在理解路径是语义视觉编码器的情况下出现,这表明统一权重是不够的:两个方向必须在入口点共享语义格式。利用该规则,中间堆栈对齐目标获得了模型的一般文本到图像能力相对损失 $0.1\%$ 的概念,而标准生成路线的损失为 $41\%$。我们的代码位于 https://github.com/Zane-ZYQiu/entry-point-umm。