论文

面向多模态推理奖励模型的熵引导数据高效训练

Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models

模型训练奖励建模与过程监督

摘要

多模态奖励模型对于将多模态大语言模型与人类偏好对齐至关重要。近期工作将推理能力融入这些模型,取得了可观成果。然而,训练这些模型面临两个关键挑战:(1)偏好数据集中固有的噪声会降低模型性能;(2)常规训练方法忽视样本难度差异,效率低下。在本文中,我们发现响应熵与准确率之间存在强相关性,表明熵可作为标注噪声与样本难度的可靠且无监督的代理。基于这一洞见,我们提出一种面向多模态推理奖励模型的新型熵引导训练(EGT)方法,它结合两种策略:(1)熵引导的数据筛选,以减轻不可靠样本的影响;(2)熵引导的训练策略,逐步引入更复杂的样本。跨三个基准的大量实验表明,经 EGT 训练的模型稳定优于最先进的多模态奖励模型。

面向多模态推理奖励模型的熵引导数据高效训练
图3:我们所提出的熵引导数据高效训练方法概览。该过程包括三个阶段:(1)推理增强,其中指令模型在高质量推理轨迹上进行微调;(2)熵引导的数据筛选,其中经推理增强的模型通过识别高熵样本来精简偏好数据集。在该阶段,由推理奖励模型探测到的熵作为样本难度和噪声的代理指标;(3)数据高效训练,其中最终模型在筛选后的数据集上通过强化学习进行训练,遵循由易到难的进程,样本按熵递增的顺序引入。