论文

解释比单独预测更难:将MLLM基于概念的解释作为ICL视觉分类器进行评估

Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers

模型评测上下文与知识本体模型能力评测

摘要

上下文学习(ICL)使多模态大语言模型(MLLM)能够依据少量带标注样本对图像进行分类。然而,这些模型如何使用所提供的上下文仍不透明。尽管思维链提示被广泛使用,近期工作认为它可能并不反映真实的内部计算。本文在少样本ICL下,使用五个形式严格性递增的实验条件——从基线分类到描述逻辑(DL)公理生成——系统评估冻结MLLM基于概念的可解释性。通过一个独立的LLM-as-a-judge流程评估四个最先进的MLLM,我们证明解释确实比单独预测更难。出人意料的是,强迫模型生成形式化的、基于概念的解释会使预测准确率单调下降(从93.8%降至90.1%),这与显式推理普遍提升性能的假设相矛盾。然而,当模型成功表述出具有类别区分性的视觉特征时,解释质量与正确预测强相关。我们的发现表明,MLLM虽擅长视觉分类,却缺乏实现正式的、机器可验证的可解释性所需的专门指令微调。

解释比单独预测更难:将MLLM基于概念的解释作为ICL视觉分类器进行评估:论文配图
图 1:情境学习分类-解释和评估管道概述。多模态 LLM 既充当分类器又充当解释器,而单独的 LLM 作为法官评估九个基于概念的 XAI 指标 (1–5 ↑\uparrow):请参阅表 1。所示的示例对应于 E3(基于特征的解释),其中提示模型识别支持分类所需的最小的足够的关键、具体和可观察的视觉特征集。法官使用不同的 MLLM 和提示,在相同的九个评估维度上对生成的解释进行评分。