论文
Re$^3$Cap:通过强化学习进行检索引导的图像字幕增强细化
Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning
摘要
强化学习 (RL) 在图像描述方面取得了显着进展,但在鼓励大型视觉语言模型 (LVLM) 探索新颖的推理策略方面仍然有限。这种限制导致 RL 和监督式 微调 (SFT) 之间存在性能差距。在本文中,我们认为多模态检索可以作为标题细化的有效推理信号。基于这一见解,我们提出了图像字幕的检索引导细化(Re$^3$Cap),这是一种检索引导推理策略,可以增强图像字幕而无需额外的注释。该策略由字幕细化建议器 (CRS) 和字幕质量评估器 (CQA) 实例化,可识别图像字幕中的幻觉和遗漏,从而获得更准确和详细的描述。大量的实验证明了我们的方法在图像字幕方面的优越性,甚至与监督 微调 相比也是如此。特别是,Re$^3$Cap 的表现优于 GRPO,在 COCO-LN500 基准上的关系推理方面平均提高了 8.64%。