论文
推理模型不仅仅思考时间更长,而且移动方式不同
Reasoning Models Don't Just Think Longer, They Move Differently
摘要
经过推理训练的语言模型通常会在更困难的问题上花费更多的标记,但较长的思维链并不能表明模型是否只是计算更多步骤或遵循不同的内部轨迹。我们通过竞争性编程、数学和布尔可满足性的思想链生成过程中的隐藏状态轨迹来研究这种区别。原始轨迹几何形状很大程度上受生成长度的影响:较长的生成会机械地改变路径统计数据,因此如果不进行调整,依赖于难度的比较会产生误导。在对长度进行残差轨迹统计之后,困难仍然系统地与所有研究领域的校正轨迹几何形状耦合。最清晰的特定于推理的分离出现在代码域中,其中较难的问题显示出与匹配的指令调整基线相比,推理训练模型中更直接的校正轨迹和更少的异质局部曲率。修正后的难度-几何耦合较弱,但在数学和布尔可满足性中仍然存在。快速阶段线性探测并不反映码域分离,行为注释表明更强的校正耦合与策略转变和不确定性监控同时发生。总之,这些发现将长度校正确立为生成时轨迹分析的先决条件,并表明推理训练可以与不同的校正轨迹几何形状相关联,其效果的强度取决于领域。