论文

DT2IT-MRM:面向多模态奖励建模的去偏偏好构建与迭代训练

DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling

模型训练奖励建模与过程监督

摘要

多模态奖励模型(MRM)在将多模态大语言模型(MLLM)与人类偏好对齐方面发挥着关键作用。训练一个好的MRM需要高质量的多模态偏好数据。然而,现有偏好数据集面临三个关键挑战:偏好强度缺乏粒度、文本风格偏差以及不可靠的偏好信号。此外,现有开源多模态偏好数据集存在大量噪声,但缺乏有效且可扩展的数据治理方法来提升其质量。为解决这些局限,我们提出DT2IT-MRM,它集成了一个去偏偏好构建流水线、对文生图(T2I)偏好数据的新颖重构,以及一个面向多模态奖励建模、用于治理现有多模态偏好数据集的迭代训练框架。我们的实验结果表明,DT2IT-MRM在三个主要基准上取得了新的最先进综合性能:VL-RewardBench、Multimodal RewardBench和MM-RLHF-RewardBench。

DT2IT-MRM:面向多模态奖励建模的去偏偏好构建与迭代训练:论文配图
图 1:我们的 DT2IT-MRM 概述。在第一阶段-偏好数据构建中,我们分别构建单图像和多图像偏好数据以用于初始 MRM 训练。 (a)我们针对单图像偏好对的去偏偏好蒸馏流程由五个步骤组成:(1)提示收集,(2)候选响应生成,(3)列表评分,(4)针对不同偏好的多样性增强,以及(5)逐点评分以减轻位置偏差。 (b) 为了构建多图像偏好数据,我们将原始文本到图像偏好数据转换为多图像、图像理解偏好数据,以便 MRM 更容易学习。 (c) 在 MRM 训练的第二阶段,我们迭代地交替训练 MRM 和管理偏好数据。 (d) 我们的数据管理管道由两种类型的奖励模型一致性检查和 MLLM 注释组成。