论文
GoldiCLIP:平衡语言图像预训练显式监督的金发姑娘方法
GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining
摘要
直到最近,大规模视觉语言模型(VLM)的成功主要依赖于十亿个样本数据集,这对进展构成了重大障碍。最新的工作已经开始通过提高监督质量来缩小这一差距,但每项工作都只解决了对比预训练中的一小部分弱点。我们提出了 GoldiCLIP,这是一个建立在寻找监管信号适当平衡的金发姑娘原则基础上的框架。我们的多方面训练框架协同结合了三个关键创新:(1)文本条件自蒸馏方法来对齐文本不可知和文本条件特征; (2) 具有视觉问答 (VQA) 目标的编码器集成解码器,使编码器能够泛化到类似图像描述的查询之外; (3)基于不确定性的加权机制,自动平衡所有异构损失。 GoldiCLIP 仅使用 3000 万张图像进行训练,数据量比领先方法少 300 倍,在数据高效方法中达到了最先进的水平,在 MSCOCO 检索上比最佳可比基线提高了 2.2 个点,在细粒度检索上提高了 2.0 个点,在基于问题的检索上提高了 5.9 个点,同时与数十亿规模的模型保持了竞争力。项目页面:https://petsi.uk/goldiclip。