论文
CircuitProbe:通过稳定区检测预测Transformer中的推理电路
CircuitProbe: Predicting Reasoning Circuits in Transformers via Stability Zone Detection
摘要
Transformer语言模型包含局部化推理电路,即在推理时被复制后能提升推理能力的连续层块。目前寻找这些电路需要暴力扫描,每个模型耗费25 GPU小时。我们提出CircuitProbe,它基于激活统计量在CPU上于5分钟内预测电路位置,带来三到四个数量级的加速。我们发现推理电路分为两类:早期层中的稳定性电路,通过表征变化的导数检测;后期层中的幅度电路,通过异常评分检测。我们在横跨6种架构的9个模型(包括2025年模型)上进行验证,确认CircuitProbe的最高预测在所有验证案例中都与最优电路一致或相差不超过2层。在Qwen 2.5系列上的扩展实验显示,层复制始终有利于3B参数以下的模型,但会使7B以上模型性能下降,这使其成为小型语言模型的实用扩展技术。CircuitProbe最少只需10个校准样本,且其预测在英语、印地语、中文和法语间保持稳定。
