论文
模态门控深度适配器:将模态添加到精确保留的冻结嵌入模型中
Modality-Gated Deep Adapters: Adding a Modality to a Frozen Embedding Model with Exact Preservation
摘要
多模态嵌入模型被大规模部署:检索索引、基准测试结果和行为审计都取决于基础模型的确切输出。使用现有的参数高效方法将这样的模型扩展到新的模态,会默默地改变这些输出;无论权重是否合并,LoRA 风格的适配都会重写文本路径,从而使每个存储的嵌入无效。我们提出模态门控深度适配器:附加到冻结多模态嵌入 LLM 的每个解码器层的瓶颈适配器,分组为每个模态包,仅在编码其自己的模态时执行。结果是对现有输出添加零更改的模式:输入无包声明遍历基本模型自己的计算图,逐位不变,并且共同加载的包由精确的零隔离矩阵组成。这两个属性都被表述为命题,在任意训练后而不是仅在初始化时保持,在推理时不需要任务标签或路由元数据,并且通过对已发布检查点的精确相等测试进行验证。在一个冻结的 2B 基础上,音频包(作为连接器词元注入)将音频到文本的 R@10 比经过相同训练的控制提高了 +3.4 到 +5.4 点,每个种子均为正值,并以数据的 11 倍再现;热包重复利用了基地自身的冷冻视觉路径,在每个种子处清除其预先注册的接受门大约七倍,并将热文本 R@10 从 0.224 提升到 0.785。编码器交换定位了缺失的容量:在 CLAP 式比较中排名优于 Whisper 系列编码器的外部音频编码器在冻结的 LLM 内损失了 16 R@10 点,因此该容量属于层中,正是门控适配器放置它的位置。我们发布了音频模型、热包以及训练、评估和不变性套件:模型位于此 http URL,代码位于 GitHub。