CBX-Bench:一个人性化的 MLLM 委员会,用于基准概念瓶颈模型解释
CBX-Bench: A Human-Aligned MLLM Council for Benchmarking Concept Bottleneck Model Explanations
摘要
概念瓶颈模型 (CBM) 旨在通过人类可理解的概念表达预测,从而使视觉分类变得可解释。尽管可解释性是 CBM 的核心动机,但它们仍然主要通过下游分类准确性作为预测模型进行评估,并辅以孤立的定性示例。这凸显了对定量测量的迫切需要,由于 真值 概念注释大规模的不可行性以及由于缺乏共识而导致概念列表的开放性,这一挑战变得更加复杂。为了填补这一空白,我们开发了一个多模态 大语言模型 (MLLM) 委员会,根据给定图像及其 CBM 解释,该委员会会生成解释质量分数。为了奠定和验证委员会的基础,我们首先进行人类研究,建立 CBM 解释质量的 真值 参考:对于图像,注释者比较 LF-CBM、VLG-CBM 和 CBM-Suite 中两个的解释,并选择更有用的一个,或将它们标记为同样好或同样坏,在 CUB-200、ImageNet-100、ImageNet-100 上的 900 个图像比较项目上产生 2700 个判断。和 Places365。与此人类参考相比,我们由开放权重 MLLM 组成的五模型委员会恢复了超过 70% 的严格人类偏好排名,在人类注释者一致同意的项目上上升至 83%。在此经过验证的委员会的基础上,我们引入了 CBX-Bench,这是一个公共基准和排行榜:新 CBM 的作者可以提交其模型的解释,CBX-Bench 会与委员会一起对它们进行评分,并维护数据集级别的解释质量排名。因此,CBX-Bench 提供了一种人性化、可扩展的 CBM 解释评估,超越了准确性和孤立的定性示例。该基准可在 https://github.com/meric-karadag/cbx-bench 上获取。