论文

MLLM 失败的地方及其原因:用于能力故障诊断的因果任务分解

Where MLLMs Fail and Why: Causal Task Decomposition for Capability Failure Diagnosis

模型评测评测方法与指标

摘要

组合任务的端到端准确性记录了 MLLM 失败的频率,但无法区分失败是否反映了目标能力的内在缺陷或来自上游先决条件的级联错误。我们提出了一个因果分解框架,通过对每个任务的先决条件依赖性的受控干预来隔离这两种故障模式。我们的能力指标(NC、IC、RC)在无协助、正确或不正确的先决条件下对每项任务进行评分,以诊断故障发生的位置;根据因果关系概率改编的贡献指标(N-分数、S-分数)量化每个先决条件的必要性和充分性以确定原因。我们在 CADET 中实例化了该框架,这是一个由 10 个复合任务组成的诊断基准,分解为 46 个单元任务,包含超过 33,000 个人工注释的问题,涵盖感知、空间、时间和认知类别。使用我们的框架诊断前沿 MLLM 可以揭示端到端准确性所掩盖的系统模式。就能力而言,提供正确的先决条件可以消除认知任务中 54% 的错误,将它们从最弱的空间和时间提升到更高的水平。从先决条件来看,因果贡献集中在几个关键先决条件中,仅提供一个最重要的先决条件就获得了提供所有先决条件所带来的 84% 的收益。