论文

OmniJudge还是OmniBias?以平衡、解耦的透镜诊断多模态评审模型

OmniJudge or OmniBias? Diagnosing Multimodal Judges through Balanced, Decoupled Lenses

模型评测基准与评测资源

摘要

能够联合评判文生图(T2I)、文生视频(T2V)和文生语音(TTS)生成的多模态理解模型,正日益被用作“OmniJudge”进行评估和自动标注。它们对所评分内容的理解有多可靠仍不清楚,因为现有基准和训练数据往往过度强调正例并混淆不同的失败模式,导致评审模型可能在没有识别失败的情况下评分良好,其能力缺口因此被掩盖。受此启发,我们提出D3-Omni,一个用于诊断细粒度多模态理解的平衡且解耦的基准,覆盖三项任务上的53个正交二元维度(17/22/14)和10,671个样本(3,526/1,998/5,147)。我们没有重新生成输出——那可能导致跨维度的信息泄漏——而是固定经验证的完全正例种子,通过受控提示改写和原子化、维度隔离的扰动派生负例。由此得到的D3设计是双平衡的(Dual-balanced),有助于缓解负样本稀缺和每维度标签不平衡;解耦的(Decoupled),使每个错误可归因于单一能力;动态的(Dynamic),随着生成模型改进而将构建导向标签分布中欠代表的区域。该套件达到接近1:1的逐维度平衡,以及在所有总分水平上的均匀分布。在这一平衡视角下,即使是强大的OmniJudge也倾向于在与模态相关的维度上表现挣扎,确认已满足需求远比检测被违反的需求可靠,并把名义上不同的属性当作大致单一的决策处理。这表明总体准确率可能掩盖系统性盲点,而平衡且解耦的透镜有助于暴露并进而解决这些盲点。