论文
妥协的几何:通过可控模态对齐解锁生成能力
The Geometry of Compromise: Unlocking Generative Capabilities via Controllable Modality Alignment
摘要
CLIP 等视觉语言模型 (VLM) 学习图像和文本的共享嵌入空间,但它们的表示仍然在几何上分离,这种现象称为模态间隙。这一差距限制了需要跨模式互换性的任务,例如字幕和联合聚类。现有的后处理方法可以部分提高跨模态兼容性;然而,我们通过几何分析表明,它们主要减少了全局质心偏移,同时保持潜在的分布失配完好无损。我们将模态差距分解为质心差距和分布差距,并证明分布差距是跨模态任务质量的真正预测因子($R^2 = 0.986$),而常用的原始差距具有误导性($R^2 = 0.691$)。受这一观察的启发,我们提出了 TPC-CMA(跨模式对齐的三相课程),这是一个明确减少这两个组件的 微调 框架。所提出的 CMA 联合减轻了质心偏移并重塑了分布结构,而具有梯度感知调度的三阶段课程在训练期间逐步引入对齐以实现稳定的优化。实验表明,我们的方法显着改善了跨模式对齐。使用 $α_{\text{target}}{=}0.05$,模态差距减少了 66.6\%,准确率仅下降 4.84\%。在更强的对齐($α_{\text{target}}{=}0.5$)下,差距减少了 82.3\%,聚类 ARI 从 0.318 提高到 0.516,字幕 CIDEr 比原始模型增加了 57.1\%。我们的代码和预训练模型将在接受后公开发布。