论文

你在想我在想什么吗? :检查神经架构中的概念分离

Are You Thinking What I am Thinking? : Examining Conceptual Separation in Neural Architectures

模型评测模型行为与机制分析

摘要

神经网络越来越多地被用来识别明确定义和模糊的概念,但输出级指标却很少揭示这些概念在内部如何表示。我们的研究询问这些网络是否表现出 \textit{概念分离}:同一概念的示例是否形成连贯的表示,以及相关概念在表示空间中是否更接近。我们通过对其内部激活的几何和分布分析来检查卷积神经网络 (CNN) 和 大语言模型 (LLM) 中的概念组织。在 CNN 中,熟悉的 ImageNet 概念形成连贯且语义有序的表示,而对于未见过的概念,这种连贯性会减弱,并会遭受类内域转移。在 LLM 中,明显不同的域保持良好的分离,相关的子域靠得更近,模糊主题之间的区别在均值和协方差水平上都消失了。这些结果表明,概念分离可以揭示仅靠输出准确性无法揭示的结构,并且可以作为对模型表示要求识别的概念的稳健程度的有用诊断。代码和数据可在 \href{https://github.com/JaeeRoshniCapstoneProject/Are-You-Thinking-What-I-m-Thinking-Examining-Conceptual-Separation-in-Neural-Architectures}{GitHub} 上找到。