论文
DeltaRubric:通过联合规划和验证进行生成多模式奖励建模
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
摘要
协调多模态 大语言模型 (MLLM) 需要可靠的奖励模型,但现有的单步评估器可能会受到懒惰判断的影响,利用语言先验而不是细粒度的视觉验证。虽然基于标题的评估减轻了纯文本环境中的这些偏差,但将其扩展到多模式任务却因视觉推理的复杂性而受到瓶颈。响应之间的关键差异通常取决于特定于实例的视觉细节。稳健的评估需要动态综合隔离空间和事实差异的标准。为了解决这个问题,我们引入了 $\textbf{DeltaRubric}$,一种将多模式偏好评估重新表述为单个 MLLM 内的计划和执行过程的方法。 DeltaRubric 分两个步骤运行:首先充当 $\textit{Disagreement Planner}$,模型生成中立的、特定于实例的验证清单。转换为 $\textit{Checklist Verifier}$,它对图像和问题执行这些自我生成的检查,以产生最终的有根据的判断。我们将 DeltaRubric 制定为多角色强化学习问题,共同优化规划和验证能力。 DeltaRubric 在 Qwen3-VL 4B 和 8B Instruct 模型上进行了验证,取得了扎实的经验收益。例如,在 VL-RewardBench 上,它通过 $\textbf{+22.6}$ (4B) 和 $\textbf{+18.8}$ (8B) 点提高了基本模型的整体准确性,很大程度上优于标准的无标题基线。结果表明,将评估分解为结构化的、可验证的步骤可以产生更可靠、更通用的多模式奖励模型。