论文
用于详细图像描述的动量耦合量规自适应
Momentum-Coupled Rubric Adaptation for Detailed Image Captioning
摘要
详细的图像字幕需要对细粒度视觉内容进行准确、全面的描述,而字幕质量涵盖事实准确性、信息覆盖范围和清晰度。与主要依赖高质量监督或整体奖励的传统方法相比,基于规则的强化学习将这些要求分解为明确的标准,并提供有针对性的结构化反馈。然而,现有的方法通常使用单独的模型来生成标题、构建标题和进行判断,这可能会导致不同角色的解释不一致。一些动态评分方法在标题策略和评分生成器之间交替更新,同时保持判断固定,但分阶段优化仍然可能使评分标准构建和判断与策略优化不同步。我们提出了 MoCo Rubric,这是一个协调这些角色的两阶段框架。首先,角色条件化、共享参数的多任务监督微调配备了单一视觉语言模型来充当标题策略、Rubric 生成器和 Rubric Judge。然后,生成器根据当前政策采样的标题、参考标题和图像证据在线构建评分细则。评审提供基于规则的奖励,并且只有政策会收到 GRPO 更新。随着策略更新改变正在评估的候选人,我们使用策略参数的指数移动平均值来更新生成器和判断器共享的一个动量模型。这种逐步转移让两个规则角色可以跟踪策略更新,而无需单独的 RL 优化,同时平滑可能会在直接同步下破坏其规则功能的参数更改。在五个字幕基准测试中,MoCo Rubric 的平均成对获胜率为 72.83%,是盲排中最好的平均排名,也是基于字幕的问答中平均得分最高的。