论文

表征简单性和电路尺寸以阈值相关的方式分离:通过对抗性训练进行的受控测试

Representational Simplicity and Circuit Size Dissociate in a Threshold-Dependent Way: A Controlled Test via Adversarial Training

模型评测模型行为与机制分析

摘要

稀疏自动编码器的可分解性和集中特征归因越来越被视为模型计算更容易进行逆向工程的证据。这种表征和归因的清洁性是否真的预示着更小或更容易处理的因果回路仍然是一个悬而未决的问题。我们使用对抗性训练作为受控工具直接对此进行测试:它可靠地重塑了内部表示,但这本身并不构成对电路尺寸的测试。我们通过逆向工程复杂性来研究这个问题:在固定的忠实度水平上恢复模型行为所需的因果结构。据我们所知,这是第一个受控的实证测试,检验表征或归因的简单性是否转化为电路层面的因果简单性。从相同的预训练 GPT-2 Small 检查点开始,我们应用匹配的标准和对抗性持续训练,要求这两个条件都保留间接对象识别的能力,并在比较机制之前通过独立的鲁棒性验证。然后,我们沿着三个互补轴比较模型:稀疏自动编码器的可分解性、任务归因中的 S​​AE 特征参与以及从原始计算图中恢复的忠实电路的大小。鲁棒模型更容易被 SAE 分解,并且在任务归因中使用更少的 SAE 特征。电路大小取决于机制:根据能力匹配的 IOI,标准领先或忠诚度低于 85%,但鲁棒性需要在高忠诚度(90%、95%)下显着减少边缘,这是在主要对上建立的模式,而代表性趋势则在七点扫描和第二个语料库中推广。