论文

文本作为部分约束:鲁棒视觉语言学习的核心残差对齐

Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning

模型训练预训练

摘要

视觉语言对齐为开放词汇识别、检索和 LVLM视觉定位提供了动力,但自然图像描述通常未指定,导致相似性脆弱,并且在释义和省略细节时过于自信。我们的目标是学习表示,其匹配在图像描述视图中稳定,其置信度反映了文本对图像的约束程度。我们提出文本作为部分约束(TPC),这是一种核心残差对齐框架,将多视图图像描述视为不完整的监督。它提炼出一致的语义核心作为对齐目标,通过一个查询学习用于标准推理的单视图核心预测器,并明确阻止视觉语言相似性依赖于正交的未说残差。当图像描述视图不一致时,具有不确定性的对比目标会进一步软化一致性,从而减少弱语言约束下过度自信的更新。在零样本识别和对抗鲁棒性方面,TPC 在 ImageNet 上实现了 81.42/64.05 Top-1 clean/robust 精度,在 Avg-14 传输套件上实现了 76.19/52.03,同时在 LLaVA-1.5-7B 堆栈下以 85.16 POPE F1 和 59.57 OKVQA 精度改进了 LVLM 传输。这些结果表明,将文本建模为部分约束是在未指定的语言监督下实现更可靠的视觉语言表示的实用且原则性的途径。