论文
解释比单独预测更难:将MLLM基于概念的解释作为ICL视觉分类器进行评估
Explaining is Harder Than Predicting Alone: Evaluating Concept-based Explanations of MLLMs as ICL Visual Classifiers
摘要
上下文学习(ICL)使多模态大语言模型(MLLM)能够依据少量带标注样本对图像进行分类。然而,这些模型如何使用所提供的上下文仍不透明。尽管思维链提示被广泛使用,近期工作认为它可能并不反映真实的内部计算。本文在少样本ICL下,使用五个形式严格性递增的实验条件——从基线分类到描述逻辑(DL)公理生成——系统评估冻结MLLM基于概念的可解释性。通过一个独立的LLM-as-a-judge流程评估四个最先进的MLLM,我们证明解释确实比单独预测更难。出人意料的是,强迫模型生成形式化的、基于概念的解释会使预测准确率单调下降(从93.8%降至90.1%),这与显式推理普遍提升性能的假设相矛盾。然而,当模型成功表述出具有类别区分性的视觉特征时,解释质量与正确预测强相关。我们的发现表明,MLLM虽擅长视觉分类,却缺乏实现正式的、机器可验证的可解释性所需的专门指令微调。
