CapRL++:图像与视频描述生成的统一可验证奖励强化学习
CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning
摘要
图像和视频图像与视频描述是连接视觉和语言领域的基本任务,在 预训练 大型视觉语言模型 (LVLM) 中发挥着关键作用。当前最先进的图像与视频描述模型通常使用监督式 微调 (SFT) 进行训练,这种范式依赖于昂贵的、不可扩展的注释,并且通常会导致模型记住特定的 真值 答案,从而限制了它们的通用性和生成多样化、创造性描述的能力。为了克服这些限制,我们建议将具有可验证奖励的强化学习(RLVR)应用于多模态图像与视频描述的开放式任务。我们引入了图像与视频描述强化学习++(CapRL++),这是一种新颖的无参考训练框架,它通过其实用性重新定义了图像与视频描述质量:高质量的图像与视频描述应该使非视觉语言模型能够准确地回答有关相应视觉内容的问题。 CapRL++ 采用解耦的两级管道,其中 LVLM 生成标题,而客观奖励源自单独的、无视觉的 LLM 仅基于该标题回答多项选择题的准确性。对 20 多个图像和视频基准的评估表明,CapRL++ 提高了密集图像与视频描述质量,并加强了跨空间和时间理解等任务的基于图像与视频描述的预训练。对 CapRL++ 注释的可扩展图像和视频图像与视频描述数据集进行预训练可产生巨大的下游收益。此外,在用于图像与视频描述质量评估的 Prism 框架内,使用 CapRL++ 训练的紧凑模型可实现与 Qwen2.5-VL-72B 和 Qwen3-VL-235B-A22B 等更大的模型相当的密集图像与视频描述性能。这些结果验证了 CapRL++ 可以有效地训练模型来生成可泛化的高保真描述,从而为超越传统 SFT 的局限性奠定了坚实的基础。