论文
由精细到粗略监督的 SigLIP-HD
SigLIP-HD by Fine-to-Coarse Supervision
摘要
高质量的视觉表示是计算机视觉领域长期以来的追求。在多模态 LLM (MLLM) 的背景下,输入更高分辨率的图像可以产生更细粒度的视觉标记。然而,由于多次前向传递和增加词元的后处理,它引入了额外的计算和设计复杂性。在简单地采用更高的分辨率之前,我们是否真正解锁了模型在标准分辨率下的完整感知能力?因此,我们研究一个有趣的问题:如何在不使用较大图像的情况下,以较低的成本实现良好的视觉感知。我们在这项工作中展示了 SigLIP-HD。核心是高度简单的由细到粗的监督设计。我们强制使用中分辨率图像的粗粒度特征来模仿其高分辨率版本的细粒度特征。我们在先进的 SigLIP 2 模型上构建了这个框架。我们的最终模型以完全相同的推理预算产生更好的视觉标记。它在广泛的 MLLM 基准上进行了验证,并且始终提供比我们的基准模型更强大的结果,尤其是在 OCR 相关任务上。