论文
大门总是关闭的:向冻结的视觉语言模型注入辅助信号
The Gate Always Closes: On Injecting Auxiliary Signals into Frozen Vision-Language Models
摘要
VLM 中的辅助信号路径通常配备可学习门,以便优化器可以决定接纳多少信号。我们发现优化器几乎总是决定为零:在五种注入设计中,每个门控路径在行为上都变得封闭,即使门参数名义上会传递 30-45% 的信号,精度也不会在推理时消融路径。我们将这种抑制现象归因于两种机制,一种是通过图像衍生信号的图像描述不变性形式化的死梯度机制,另一种是辅助信号主动损害损失的负效用机制。我们不是对抗抑制,而是利用它:我们使用双曲视觉关系图的几何辅助损失(IoA 驱动的蕴涵锥和洛伦兹流形上的角斥力)对 LoRA 微调 进行正则化,仅通过训练时的前向传递进行耦合,并在推理时丢弃。按问题类型分解 GQA 会暴露出一种明显的分离。推理时没有几何损失的三种配置在关系问题上损失了 2.85-3.39pp,而在属性问题上增加了约 1pp;第四个模型使用损失进行训练,但通过软提示进行推断,在 rel 上损失 5.14pp,而在 attr 上仅损失 +0.23pp,因此,如果没有几何推理路径,单独的训练时间正则化并不能保护关系准确性。保持几何路径推理的配置可以保持普通级别的关系准确性并匹配属性增益。在 VSR 上的分布之外,RMS 前缀配方保留了空间信号;去除几何损失 (G2) 会使 VSR 下降 4.6pp,将它们隔离为 OOD 源。第二个结果:嵌入规范对齐对于生成安全的前缀注入是必要的,并且可学习的门应该替换为匹配规模的固定的、非可选的注入。