论文
DT2IT-MRM:面向多模态奖励建模的去偏偏好构建与迭代训练
DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling
摘要
多模态奖励模型(MRM)在将多模态大语言模型(MLLM)与人类偏好对齐方面发挥着关键作用。训练一个好的MRM需要高质量的多模态偏好数据。然而,现有偏好数据集面临三个关键挑战:偏好强度缺乏粒度、文本风格偏差以及不可靠的偏好信号。此外,现有开源多模态偏好数据集存在大量噪声,但缺乏有效且可扩展的数据治理方法来提升其质量。为解决这些局限,我们提出DT2IT-MRM,它集成了一个去偏偏好构建流水线、对文生图(T2I)偏好数据的新颖重构,以及一个面向多模态奖励建模、用于治理现有多模态偏好数据集的迭代训练框架。我们的实验结果表明,DT2IT-MRM在三个主要基准上取得了新的最先进综合性能:VL-RewardBench、Multimodal RewardBench和MM-RLHF-RewardBench。
