论文

ConceptTracer:神经表征中概念显着性和选择性的交互式分析

ConceptTracer: Interactive Analysis of Concept Saliency and Selectivity in Neural Representations

模型评测模型行为与机制分析

摘要

神经网络在各种任务中提供令人印象深刻的预测性能,但它们的决策过程通常是不透明的。尽管人们对机械可解释性越来越感兴趣,但用于系统地探索一般神经网络学习的表示(特别是表格基础模型)的工具仍然有限。在这项工作中,我们介绍了 ConceptTracer,这是一种交互式应用程序,用于通过人类可解释的概念来分析神经表征。 ConceptTracer 集成了两种信息论测量方法,可量化概念显着性和选择性,使研究人员和实践者能够识别对单个概念强烈反应的神经元。我们展示了 ConceptTracer 在 TabPFN 学习到的表示上的实用性,并表明我们的方法有助于发现可解释的神经元。这些功能共同提供了一个实用的框架,用于研究 TabPFN 等神经网络如何编码概念级信息。 ConceptTracer 可在 https://github.com/ml-lab-htw/concept-tracer 获取。