论文

向后兼容多模态表示的球面插值

Spherical Interpolation for Backward-Compatible Multimodal Representations

模型推理解码与生成控制

摘要

对比视觉语言模型将视觉和文本表示映射到共享的归一化嵌入空间中,使余弦相似度成为跨模式检索的自然度量。模型升级过程中出现了一个实际挑战:独立训练的模型通常会产生不兼容的表示空间,因此替换已部署的模型通常需要重新计算整个图库的嵌入,这在规模上是非常昂贵的。正交事后对齐可以通过将新模型查询映射到旧模型库空间来部分缓解此问题。然而,由于独立训练的模型在细粒度表示结构方面可能有所不同,因此正交对齐保持近似,从而在旧模型查询和对齐的新模型查询之间留下残余角度差异。我们研究在这两个标准化查询表示之间沿着球形测地线进行插值是否可以在不重新索引图库的情况下改进检索。我们表征该路径何时包含比任一端点更接近理想化检索最佳方向的内部查询方向,并通过本地基于边际的认证结果将此表征连接到 Recall@$K$。跨多个基准和模型系列的实验表明,对齐后球形插值比单独的正交对齐有所改进,在大多数评估设置中恢复了向后兼容性。与我们的几何特征一致,每个查询的预言机分析表明,在实践中,有利于检索的内点经常出现。代码可在 https://github.com/miccunifi/SLERP_backward_compatibility 获取。