论文

学习重要的事情:可解释的视觉语言奖励模型的动态维度选择和聚合

Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling

模型训练奖励建模与过程监督

摘要

视觉语言奖励建模面临着一个困境:生成方法是可解释的,但速度很慢,而判别方法虽然有效,但充当不透明的“黑匣子”。为了弥补这一差距,我们提出了 VL-MDR(视觉语言多维奖励),这是一个将评估动态分解为细粒度、可解释维度的框架。 VL-MDR 不是输出整体标量,而是采用视觉感知门控机制来识别相关维度并针对每个特定输入自适应地对其进行加权(例如幻觉、推理)。为了支持这一点,我们整理了一个包含 321k 个视觉语言偏好对的数据集,并在 21 个细粒度维度上进行了注释。大量实验表明,VL-MDR 在 VL-RewardBench 等基准测试中始终优于现有开源奖励模型。此外,我们还表明,VL-MDR 构建的偏好对有效地使 DPO 对齐能够减轻视觉幻觉并提高可靠性,从而为 VLM 对齐提供可扩展的解决方案。