论文
讲述故事的规范:$\ell_2$ 幅度作为 大语言模型 中动态推理的信号
The Tell-Tale Norm: $\ell_2$ Magnitude as a Signal for Reasoning Dynamics in Large Language Models
摘要
最近的工作试图理解 大语言模型 (LLM) 推理,但捕获其分层推理动态的有原则的模型内在信号仍未得到充分探索。我们通过证明隐藏状态的 l2 范数作为模型推理强度的内生信号来弥补这一差距。使用稀疏自动编码器(SAE)作为诊断探针,我们观察到 LLM 的内部推理的特点是集中在后期层的推理特征激活急剧增加。受这种模式的启发,我们在推理强度和模型的潜在几何之间建立了正式联系,并从理论上证明了隐藏状态的 l2 范数限制了 SAE 推理特征的激活强度。经验相关分析和因果干预进一步验证了 l2 范数作为一个可靠的指标,其中提高的范数始终对应于关键推理步骤。然后,我们介绍三种由 l2 规范指导的测试时间缩放技术:(i)自适应逐层推理递归,(ii)内生推理状态引导,以及(iii)l2 引导的响应选择,它不需要额外的训练或数据,并且与高级推理引擎兼容。跨模型架构和基准的实验表明,基于 l2 范数的技术显着提高了推理性能,提供了一个有原则但简单的镜头来感知和控制 LLM 潜在推理动态。我们的代码可在 https://github.com/zjy1298/The-Tell-Tale-Norm 获取。