论文
多模态Transformer中的虚拟编码器
Virtual Encoders in Multimodal Transformers
摘要
多模态语言模型传统上依赖于专用的感知编码器来构建任务可用的表示。最近出现了更集成的架构,它将共享Transformer暴露给轻微投影的补丁、音频帧或离散的视觉词元。当未提供此类表示时,此编码在哪里发生?我们发现Transformer可以内化这种缺失的计算,在下游语言模型之前在其自己的早期到中间层中构建任务可用的感知表示。我们将这种计算结构称为虚拟编码器。通过线性探测、与感知编码器的相似性以及因果分析,我们在接收感知标记而没有连续的编码器衍生特征的模型中识别了这种结构的签名。这些分析还表明,感知和语言处理之间的边界不需要在架构模块内重合。相反,类似编码器的计算可以作为共享Transformer中的功能机制出现,为理解多模态模型在何处以及如何处理感知提供了新的视角。