论文
HyFL-CLIP:CLIP 的双曲 微调,用于稳健的长上下文理解
HyFL-CLIP: Hyperbolic Fine-Tuning of CLIP for Robust Long-Context Understanding
摘要
CLIP(对比语言-图像 预训练)已成为图像文本对齐的事实上的范例,但由于绝对位置编码和简短图像描述的预训练,它在长上下文描述(> 77 个标记)方面遇到了困难。在长上下文中,句子经常被重新排序、总结或部分省略。尽管之前的工作使用更长的位置编码扩展了 CLIP,但在这种文本扰动下,它们经常会遇到图像文本对齐退化的问题。我们将此限制归因于欧几里得对比目标,该目标强制执行严格的一对一匹配,并且缺乏用于建模全局上下文及其组成元素之间的层次关系的明确机制。为了解决这个问题,我们提出了 HyFL-CLIP,这是一个双曲 微调 框架,它通过跨流形相似性 蒸馏 将欧几里得 CLIP 中学到的完善的文本图像对齐提炼到双曲空间中,利用其几何形状来捕获层次和蕴涵关系。我们的方法通过链接总结的标记式特征、长上下文描述、组成的短文本组件和图像来建模分层语义,通过双曲蕴涵和爱因斯坦中点聚合捕获部分-整体关系。对不同基准的实验,包括长上下文跨模态检索、带标题扰动的跨模态检索、模态内检索和短文本跨模态检索,表明 HyFL-CLIP 实现了更稳健的长上下文理解。特别是,与现有最佳方法相比,在文本扰动下,它在长文本跨模态检索方面的性能提高了 19.5%。我们还表明,通过将 HyFL-CLIP 应用于稳定扩散 XL (SDXL),可以将其无缝集成到其他模型框架中。