论文

ClaimDiff-RL:通过视觉声明比较进行细粒度字幕强化学习

ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison

模型训练奖励建模与过程监督

摘要

长格式图像字幕暴露了强化学习中的奖励粒度问题:字幕被视为整个序列,而重要的错误发生在单个视觉声明的层面上。良好的密集标题应该既忠实又信息丰富,避免产生幻觉,同时又不遗漏显着的细节。然而,成对偏好、基于参考的指标和整体标量奖励将这些局部错误压缩为单个序列级信号,从而模糊了事实性和覆盖范围之间的权衡。我们引入了 ClaimDiff-RL,一个使用参考条件原子声明差异作为标题 RL 奖励单位的框架。给定图像、演员说明和参考说明,多模态法官会枚举基于视觉的差异,对照图像验证每个差异,分配开放词汇错误类型和严重性级别,并生成每个差异的奖励构成统计数据。这使得幻觉主张和遗漏的显着事实可以分别测量和调整。实验表明,整体标量奖励可以通过增加缺失的事实来减少幻觉,而 ClaimDiff-RL 则暴露了这种 忠实性 和覆盖范围的权衡,并实现更平衡的操作点。在 160 张图像的人工标记诊断基准、公共字幕基准和 VQA 基准上,ClaimDiff-RL 改善了幻觉-缺失事实的平衡,保留了一般能力,甚至在对象计数、空间关系和场景识别等几个细粒度的能力维度上超越了 Gemini-3-Pro-Preview。这些结果表明,类型化的、可验证的声明差异是细粒度和可诊断的标题强化学习的有效奖励单元。