论文

CircuitProbe:通过稳定区检测预测Transformer中的推理电路

CircuitProbe: Predicting Reasoning Circuits in Transformers via Stability Zone Detection

模型评测模型行为与机制分析

摘要

Transformer语言模型包含局部化推理电路,即在推理时被复制后能提升推理能力的连续层块。目前寻找这些电路需要暴力扫描,每个模型耗费25 GPU小时。我们提出CircuitProbe,它基于激活统计量在CPU上于5分钟内预测电路位置,带来三到四个数量级的加速。我们发现推理电路分为两类:早期层中的稳定性电路,通过表征变化的导数检测;后期层中的幅度电路,通过异常评分检测。我们在横跨6种架构的9个模型(包括2025年模型)上进行验证,确认CircuitProbe的最高预测在所有验证案例中都与最优电路一致或相差不超过2层。在Qwen 2.5系列上的扩展实验显示,层复制始终有利于3B参数以下的模型,但会使7B以上模型性能下降,这使其成为小型语言模型的实用扩展技术。CircuitProbe最少只需10个校准样本,且其预测在英语、印地语、中文和法语间保持稳定。

CircuitProbe:通过稳定区检测预测Transformer中的推理电路:论文配图
图 1:四种架构的稳定区检测。绿色条显示检测到的稳定区(表示变化的最低导数)。在 Phi-4(左上)中,这与第 6-11 层已知的真实推理电路(蓝色阴影)一致。尽管架构、规模和训练过程不同,但所有四个模型中都出现了相同的模式。