论文

关于多峰饱和的几何:黎曼 VICReg

On the Geometry of Multimodal Saturation: Riemannian VICReg

模型训练预训练

摘要

在自我监督学习中,第三种模式应该提高或至少保持表现。在九个图像-文本-表格数据集中,我们发现它反而损害了性能:在 VICReg 下,三模态模型在 55.6% 的配对运行中表现不佳,其自身的最佳双模态子集表现不佳。 SimSiam 下 51.1% 的配对运行中出现同样的故障。我们将这种故障称为多峰饱和。我们认为故障在于对齐几何形状。黎曼 VICReg (R-VICReg) 概括了经典的 VICReg:它通过可学习的负曲率乘积因子上的平方测地距离来对齐视图,并在曲率消失时准确地恢复 VICReg。在同样的 45 次配对运行中,R-VICReg 将第三种方式有帮助的概率从 44.4% 提高到 64.4%,收益集中在 VICReg 饱和的地方。