论文
您只需一目了然:使用 SimLoss 进行单通道细粒度图像字幕
A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss
摘要
一张图像可能胜过一千个单词,但大多数字幕模型只用很少的文字来描述它。现代视觉语言模型可以生成流畅的高级字幕,但通常会忽略使图像在视觉上特定的属性、计数、纹理、材料和空间关系。最近的多阶段系统通过生成、分解、验证和重写来恢复其中一些细节,但这样做的代价是推理延迟明显更高。我们提出了 SimLoss,一种用于单通道细粒度图像描述的无参考嵌入空间目标。 SimLoss 训练视觉语言模型,将其投影的隐藏状态表示与通过 InfoNCE 对比损失嵌入的冻结图像对齐,在解码任何文本之前提供密集的视觉监督信号,并且不需要人工编写的细粒度字幕,也不需要来自多级管道的伪字幕。我们将其实例化为 SimLoss FFT(通过本地可用的嵌入模型进行反向传播)和 SimLoss GRPO(将该模型视为黑盒奖励)。与单通道、多阶段验证、奖励优化和感知感知基线相比,完全可微分的 微调 变体 SimLoss FFT 实现了最高的精度,同时几乎匹配多阶段方法的 F1 分数,同时保留单通道推理,并且运行速度比多阶段管道快大约 20 倍。基于奖励的变体 SimLoss GRPO 获得了最强的召回率。总之,这些结果表明,嵌入空间监督可以在单通道字幕器的延迟下恢复多阶段验证的质量。