论文

MMPCBench:评测多模态大语言模型主动批判缺陷输入的能力

MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs

模型评测基准与评测资源

摘要

随着多模态大语言模型 (MLLM) 发展成为复杂的交互式助手,它们的可靠性不仅取决于遵循指令,还取决于对指令的验证。我们将主动批判定义为模型无需额外提示即可识别、分析和修复错误用户输入的自主能力。然而,评估主要测试理想情况下的模型或简单的拒绝行为,很大程度上忽略了主动错误处理。为了填补这一空白,我们提出了 MMPCBench,一个用于评估 MLLM 主动批评能力的综合框架。它具有 4 种主要错误类型的细粒度分类,涵盖 12 个子类别,范围从跨模式矛盾到缺失视觉前提。我们采用分层评估协议来衡量模型的错误检测、诊断和解决性能,并应用对齐感知指标来评估内部推理和最终响应之间的一致性。对 14 个主流 MLLM 的测试显示,在主动批评方面存在明显弱点,尤其是在处理细微的视觉异常方面。值得注意的是,我们发现了一个普遍存在的“一致性差距”:推理模型通常可以在内部推理过程中正确识别和分析错误,但会在最终输出中抑制这些有效见解,以优先考虑响应合规性。代码和数据可在 https://github.com/ALIENS32/MMPCBench 获取。

MMPCBench:评测多模态大语言模型主动批判缺陷输入的能力:论文配图
图2:评价管道。(a) 错误分类:将输入缺陷分类为表达错误、预设矛盾、缺少预设和超出能力。(b) 建筑管道:一个三阶段过程,其特点是多源数据取样、多模型错误注入(12k个样本)和自动/人体过滤。(c) 评价框架:通过EDA、DP和SE衡量标准进行等级评估,利用大型语言模型法官小组,将其纳入综合PCQ评分。