论文
RefCaptioner:基于多幅参考图像的有据视频描述
RefCaptioner: Multi-Reference Image-Grounded Video Captioning
摘要
现有的视频字幕模型可以生成视频内容的自然描述,但无法明确地将局部视觉元素与多个参考图像结合起来。我们引入了基于多参考图像的视频字幕,这是一项需要具有短语级参考基础的事实视频描述的新任务,并提出了 RefCaptioner,这是用于此任务的两阶段 后训练 框架。 RefCaptioner 将混合数据 SFT 与分层覆盖折扣 GRPO 相结合,共同改进参考选择、短语级绑定、干扰项拒绝和交叉参考一致性,同时保留一般视频字幕功能。为了支持训练,我们构建了一个包含 20,000 美元视频和 171,354 张参考图像的语料库。我们进一步介绍了 MRVBench,这是一个评估字幕真实性和基于现实世界和人工智能生成视频的多参考基础的基准。实验表明,RefCaptioner 在开源模型中实现了最佳的整体性能,同时在标准视频字幕基准上保持竞争力。人工评估进一步证实,其字幕是注释者的首选,并且可以使用开源和专有视频生成器实现更忠实于源的视频重建。