论文
通过面向能力的基准与MCTS驱动数据生成推进多模态评判模型
Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation
摘要
使用多模态大语言模型(MLLM)作为评判者以实现精确一致的评估,已逐渐成为各领域的新兴范式。因此,评估MLLM-as-a-judge系统的能力与可靠性对确保可信评估至关重要。现有评判基准按任务类型对样本分类,但未能捕捉可靠评估所需的基本判断能力。在这项工作中,我们提出M-JudgeBench,一个十维面向能力的基准,用于全面评估MLLM的判断能力。我们的基准把评估分解为成对思维链(CoT)比较、长度偏差规避和过程错误检测任务,共同覆盖十个细粒度子任务。这一设计能够跨推理风格、响应长度和跨模型差异诊断模型可靠性。系统性评估揭示了现有MLLM-as-a-judge系统的系统性弱点。为解决这一问题,我们进一步提出Judge-MCTS,一个生成具有不同正确性与长度的成对推理轨迹的数据构建框架。利用Judge-MCTS,我们构建了MCTS增强数据集并训练M-Judger——一系列强评判模型。大量实验证明了M-Judger在现有评判基准以及M-JudgeBench上的优越性。总体而言,我们的工作通过M-JudgeBench与Judge-MCTS框架为评估MLLM-as-a-judge确立了更有原则的基础,为未来的评判模型评估与能力驱动评判训练研究铺路。
