论文
面向多模态推理奖励模型的熵引导数据高效训练
Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models
摘要
多模态奖励模型对于将多模态大语言模型与人类偏好对齐至关重要。近期工作将推理能力融入这些模型,取得了可观成果。然而,训练这些模型面临两个关键挑战:(1)偏好数据集中固有的噪声会降低模型性能;(2)常规训练方法忽视样本难度差异,效率低下。在本文中,我们发现响应熵与准确率之间存在强相关性,表明熵可作为标注噪声与样本难度的可靠且无监督的代理。基于这一洞见,我们提出一种面向多模态推理奖励模型的新型熵引导训练(EGT)方法,它结合两种策略:(1)熵引导的数据筛选,以减轻不可靠样本的影响;(2)熵引导的训练策略,逐步引入更复杂的样本。跨三个基准的大量实验表明,经 EGT 训练的模型稳定优于最先进的多模态奖励模型。
