论文
浏览语言模型的概念空间
Navigating the Concept Space of Language Models
摘要
在 大语言模型 激活上训练的稀疏自动编码器 (SAE) 输出数千个特征,这些特征能够映射到人类可解释的概念。当前分析这些特征的实践主要依赖于检查最活跃的示例、手动浏览各个特征或对感兴趣的概念进行语义搜索,这使得大规模探索性发现概念变得困难。在本文中,我们提出了 Concept Explorer,这是一个可扩展的交互式系统,用于事后探索 SAE 功能,该系统使用分层邻域嵌入来组织概念解释。我们的方法在 SAE 特征嵌入上构建多分辨率流形,并实现从粗略概念集群到细粒度邻域的渐进导航,支持概念之间的发现、比较和关系分析。我们展示了 Concept Explorer 在从 SmolLM2 中提取的 SAE 特征上的实用性,它揭示了连贯的高级结构、有意义的子簇以及难以用现有工作流程识别的独特的稀有概念。