论文

通过 Rubric 奖励进行视觉偏好优化

Visual Preference Optimization with Rubric Rewards

模型训练偏好优化

摘要

直接偏好优化 (DPO) 的有效性取决于反映多模式任务中重要的质量差异的偏好数据。现有的管道通常依赖于 离策略 扰动或基于粗略结果的信号,这不太适合细粒度的视觉推理。我们提出了 rDPO,一种基于特定于实例的规则的偏好优化框架。对于每个图像指令对,我们创建了一个清单式的基本标准和附加标准的标题,以对任何可能的策略的响应进行评分。指令标题池是离线构建的,并在 同策略 数据构建过程中重复使用。在公共奖励建模基准上,基于标题的提示极大地提高了 30B-A3B 的判断,使其接近 GPT-5.4。在公共下游基准上,基于标题的过滤将宏观平均值提高至 82.69,而基于结果的过滤则将其从 81.14 降至 75.82。在综合基准上评估可扩展性时,rDPO 达到了 61.01,明显优于风格受限的基准 (52.36),并超过了基础模型的 59.48。总之,这些结果表明,视觉偏好优化受益于将 同策略 数据构造与特定于实例的标准级反馈相结合。