论文

哪些负样本才重要?问问你的文本编码器:面向稠密描述检索的自适应相似度边界

Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval

模型训练监督微调与指令调优

摘要

稠密描述检索(dense-caption retrieval)近来的改进来自在对比微调中引入分割、边缘图、LLM过滤描述和跨模态模块。然而,这些方法大多沿用了同样的InfoNCE目标,其优化在强预训练初始化下可能过早饱和:在稠密描述上,损失在第一个epoch内就有80%的批次降到10^-3以下,而其梯度在47%的测量中于fp32精度下变为精确零。我们发现,这一行为与稠密描述基准中存在大量近重复描述密切相关:在容易的多数样本已被分开之后,少数高度相似的负样本仍未被区分开。作为补救,我们提出HN-CLIP,它利用文本编码器自身的文本-文本几何为每个负样本构建自适应相似度边界。具体而言,将一个带detach的描述相似度矩阵加到负样本logits上,为更相似的描述分配更大的边界,而无需挖掘、合成或重采样负样本。所得目标在训练中只需一个描述相似度矩阵和一次带掩码的logit加法,不需要辅助数据、额外参数、离线预处理或推理时开销。在四个稠密描述检索基准上的大量实验表明,HN-CLIP较最强竞争者提升+2.4至+4.3 R@1,同时训练速度比GOAL快2.4倍、比StructXLIP快5.4倍。此外,所提目标在域内基准上改进了全部六个受测微调框架,并仅用20%的训练数据就达到最强的全量数据基线。

哪些负样本才重要?问问你的文本编码器:面向稠密描述检索的自适应相似度边界:论文配图
图1:密集描述(dense-caption)基准被困难负样本所主导。在测试集上用预训练的Long-CLIP-L文本编码器测得的(a)所有描述-描述两两余弦相似度和(b)每条描述的最难负样本相似度的分布。虚线标出均值。(b)中的样本对获得最强的提升。