论文

通过面向能力的基准与MCTS驱动数据生成推进多模态评判模型

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation

模型评测基准与评测资源

摘要

使用多模态大语言模型(MLLM)作为评判者以实现精确一致的评估,已逐渐成为各领域的新兴范式。因此,评估MLLM-as-a-judge系统的能力与可靠性对确保可信评估至关重要。现有评判基准按任务类型对样本分类,但未能捕捉可靠评估所需的基本判断能力。在这项工作中,我们提出M-JudgeBench,一个十维面向能力的基准,用于全面评估MLLM的判断能力。我们的基准把评估分解为成对思维链(CoT)比较、长度偏差规避和过程错误检测任务,共同覆盖十个细粒度子任务。这一设计能够跨推理风格、响应长度和跨模型差异诊断模型可靠性。系统性评估揭示了现有MLLM-as-a-judge系统的系统性弱点。为解决这一问题,我们进一步提出Judge-MCTS,一个生成具有不同正确性与长度的成对推理轨迹的数据构建框架。利用Judge-MCTS,我们构建了MCTS增强数据集并训练M-Judger——一系列强评判模型。大量实验证明了M-Judger在现有评判基准以及M-JudgeBench上的优越性。总体而言,我们的工作通过M-JudgeBench与Judge-MCTS框架为评估MLLM-as-a-judge确立了更有原则的基础,为未来的评判模型评估与能力驱动评判训练研究铺路。

通过面向能力的基准与MCTS驱动数据生成推进多模态评判模型
图2:M-JudgeBench 概览。该图展示 M-JudgeBench 中的数据构建方法及由此产生的任务类型。结果-错误对(result-error pairs)来自不同模型在不同温度与推理长度下的 rollout,而过程错误(process-error)数据则通过保留正确答案的受控噪声注入生成。这些共产生三种主要任务类型和十个子任务。