论文

VCap:弱到强视觉描述文本的超几何奖励

VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

模型训练奖励建模与过程监督

摘要

视觉描述文本要求模型忠实地捕捉视觉内容,同时最大限度地减少遗漏和幻觉。作为描述文本的主导范例,MLLM 通过扩展和高质量数据实现了强大的性能。最近,强化学习已成为推动 MLLM 实现更高精度和更广泛覆盖范围的关键途径,然而,现有的描述文本奖励设计无法为事实验证提供细粒度和可靠的信号,限制了其有效性。为了解决这个问题,我们提出了 VCap,一种见证人-裁决者奖励,它将参考描述(见证人)与视觉信号(裁决者)配对。通过明确验证基于视觉信号的参考描述文本和策略生成的描述文本之间的事实一致性,VCap 提供具有超几何分布级精度的奖励信号,用于描述文本质量验证。这种设计甚至可以从不完美的参考中进行有效的学习,从而促进强化学习训练中从弱到强的泛化。在我们的实验中,使用 VCap 训练的 8B 模型在多个图像和视频描述文本基准测试中优于开源和闭源 SOTA 模型。人类评估进一步证实了其与事实正确性的强烈一致性。此外,VCap 提高了 MLLM 感知能力,跨任务泛化,并超越了 best-of-N 蒸馏,挑战了先前关于 RLVR 的假设。