论文
视觉语言数据集蒸馏中的秩感知双曲对齐
Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation
摘要
视觉语言数据集 蒸馏 (VLDD) 将大型图像文本配对数据集压缩为一小组合成对,可以在严格的数据和计算预算下有效地训练对比视觉语言模型。大多数现有方法匹配专家轨迹或跨模式统计,但仍然在欧几里德嵌入空间中强制执行全维对齐。由于秩不足的图像-文本相关性,这通常过于严格,共享语义集中在低维范围内,而剩余变化分布在弱相关的残差子空间中。 LoRS 通过低秩分解在相似性级别上放宽了对齐,但没有明确控制表示空间中的主导对齐能力和结构。因此,我们提出了一种等级感知双曲对齐(RAHA),它将分层几何与显式对齐容量控制相结合。 RAHA 将多模态表示提升到双曲空间,并优化具有非对称目标的蒸馏对,这些非对称目标强制共享范围内的测地线对齐,同时正则化剩余子空间以保留模态私有多样性并提高传输鲁棒性。基准实验表明,RAHA 在固定预算下表现出有竞争力的跨模态检索和改进的传输指标。