论文

MAxBench:多项式概念恢复基准

MAxBench: A Multinomial Concept Recovery Benchmark

模型评测基准与评测资源

摘要

对语言模型行为(例如转向)的细粒度控制是可解释性研究中更具可操作性的成果之一。对于诸如拒绝之类的二元概念,激活空间中的单个方向通常足以进行转向。然而,许多概念并不是二元的:动物和国家包含许多子类别,每个子类别都有多个实例。对于这些概念,可能的表示几何形状的搜索空间远大于二元概念的搜索空间;因此,尚不清楚什么几何形状最合适,也不清楚什么方法最有效地恢复它们。在这项工作中,我们引入了 MAxBench,这是一种与几何无关的评估框架,用于基于从恢复的概念表示中采样的多项概念表示。我们使用 MAxBench 比较 6 个概念和 4 个模型的 10 种定位方法(涵盖 5 种几何类型)。使用这个框架,我们发现(i)仿射子空间比一级子空间或线性子空间更可靠地操纵并且具有更高的召回率; (ii) 这种优势很大程度上是由于更好的非零偏移而不是碱基的选择; (iii) 歧管转向在适用时与最佳方法相比具有竞争力; (iv) 与二元概念的先前发现一致,没有任何方法始终优于提示。这些发现强调了将可解释性研究和元评估范围扩大到具有更多样化结构的概念的重要性。