论文

架构,而非规模:大语言模型 中的电路本地化

Architecture, Not Scale: Circuit Localization in Large Language Models

模型评测模型行为与机制分析

摘要

机械解释假设随着模型规模的扩大,电路分析变得更加困难。我们通过证明注意力架构比参数计数更重要来挑战这一假设。通过研究 Pythia 和 Qwen2.5 的三种电路类型,我们发现分组查询注意力产生的电路比可比规模的标准多头注意力更加集中且机制稳定。同样的专注模式适用于间接物体识别、归纳头脑和事实回忆。在单一架构系列(Qwen2.5)中,事实回忆电路经历临界规模以上的离散相变,崩溃到单个瓶颈而不是逐渐退化。这些发现表明,某些架构选择使大型模型更易于研究,并且可解释性困难并不是模型大小的固定结果。