论文
ReasonCLIP-58M:CLIP 的以视觉证据为依据的常识推理监督
ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP
摘要
CLIP 及其变体是多模态系统中广泛采用的视觉主干,但它们的预训练仍然以描述性图像文本对齐为主。随着下游应用程序越来越需要基于视觉的常识推理和组合推理,目前尚不清楚 CLIP 式编码器是否可以在不改变架构的情况下支持此类推理。为了解决这个问题,我们提出了 ReasonCLIP-58M,这是一个持续预训练框架,通过我们的两阶段策略将大规模推理监督集成到 CLIP 式模型中,该策略在保持描述性对齐的同时逐步集成推理信号,然后是类别结构推理监督。为了支持这个框架,我们构建了两个互补的数据集和一个基准:ReasonLite-42M,具有开放形式、视觉上可验证的推理描述; ReasonPro-16M,具有特定类别的推理监督;和 RCLIP-Bench 用于视觉推理的诊断评估。我们训练了一系列 ReasonCLIP,它可以提高基于视觉的常识和组合推理,同时还增强零样本检索性能。作为 LLaVA-NeXT 等多模态 大语言模型 的嵌入式视觉编码器,ReasonCLIP 无需额外的推理成本即可提供一致的增益,这表明结构化推理监督增强了 CLIP 式视觉表示的表达能力。所有数据集、模型和训练代码均可在 https://github.com/RISys-Lab/ReasonCLIP 上获取。