论文

图像描述瓶颈模型

Caption Bottleneck Models

模型评测模型行为与机制分析

摘要

概念瓶颈模型 (CBM) 通过人类可理解的概念层进行预测,从而提供可解释性。然而,为特定数据集定义最佳概念集仍然是一个开放的挑战。现有方法依赖于昂贵的专家注释或仅基于类名的 LLM 生成的列表。即使是“开放词汇”变体通常也依赖于静态概念集,这限制了发现并引入了标签偏差。此外,传统的 CBM 经常遭受信息泄漏,未建模的视觉特征绕过瓶颈并损害解释的完整性。为了克服这些限制,我们提出了图像描述瓶颈模型(CaBM),这是一个框架,通过用自由形式的自然语言替换严格的概念层来规避对预定义概念集的需求。通过使用 LMM 生成的标题来表示图像并严格根据该文本训练分类器,CaBM 通过构建确保了无泄漏的架构。此外,通过分析文本分类器 后训练,CaBM 可以自主发现高质量的、特定于数据集的概念。我们在细粒度和粗粒度基准上的结果表明,CaBM 实现了有竞争力的准确性,同时保留了可解释性,而不受外部词典或手动标记的限制。