论文
HANCLIP:双曲角否定视觉语言模型系列
HANCLIP: A Family of Hyperbolic Angular Negation Vision Language Models
摘要
视觉语言模型(VLM)实现了强大的跨模态对齐,但仍然很容易被否定,通常依赖于浅层单词关联而不是组合推理。否定特定数据上的 微调 也会通过灾难性遗忘损害其通用功能。我们引入了 HANCLIP(双曲、角度和否定),这是一种几何感知框架,可以提高否定灵敏度,同时保留预训练的关节嵌入空间的结构。 HANCLIP 结合了双曲线对比目标(对层次关系和语义不对称进行建模)和角度三元组损失(将否定描述与肯定描述分开)。 HANCLIP 仅使用 20,000 个图像文本四元组,在 NegBench 基准测试中持续提高 CLIP、LongCLIP 和 SmartCLIP 主干网的性能,同时保持或提高零样本分类和图像文本检索性能。这些结果表明,轻量级、几何引导的目标可以增强否定理解,而无需大规模再训练。