论文

模型思考有多努力?分析LLM思维链的逐步推理能量

How Hard Does It Think? Analyzing Step-Aware Reasoning Energy in LLM Chain-of-Thought Trajectories

模型评测模型行为与机制分析

摘要

理解计算资源如何在个体链式思维(CoT)推理步骤之间分配是一个开放性挑战:现有的可解释性方法依赖于输出级别的信号或将处理深度压缩成单个轨迹级别的标量,使步骤级别的努力变得不可见。我们提出Step-Aware Reasoning Energy(SARE),这是一种几何框架,通过中心化核对齐(CKA)来量化个体CoT步骤的粒度努力,中心化核对齐(CKA)是基于相邻Transformer层的词元隐藏状态的Gram矩阵之间的中心化核对齐,不依赖于特征向量对齐或簇对应关系。SARE进一步将这种能量嵌入到推理的语义进展中,通过模型CoT轨迹作为过渡到潜在语义状态之间的转换。在六个推理基准和三个开放权重的LLMs上,我们发现推理能量在步骤类型上是高度非均匀的,表现出看不见的阶段性过渡;错误的轨迹在关键的推理交界处表现出系统性较低的能量;基于SARE的特征在大多数情况下与基于输出的置信度基准相匹配或优于,表明内部几何动态编码的预测信息超越表面级别的信号。

模型思考有多努力?分析LLM思维链的逐步推理能量:论文配图
图 1:使用 Phi-4-mini 推理 GSM8K 上每个簇的能量分布,显示无条件(左)和以轨迹正确性为条件的(右)。