论文
这是问题,而不是路径:LLM 推理轨迹中的预算和难度混淆
It's the Problem, Not the Path: Budget and Difficulty Confounds in LLM Reasoning Trajectories
摘要
大语言模型 的推理痕迹被广泛解读为包含“突破”时刻和早期清晰的命运。两种读数均基于在索赔层面缺少反事实控制的测量结果;我们提供这两种控制装置。首先,重新启动控制的截断探针将解决方案符合连续预算的时间与前缀携带新计算无法购买的值的时间分开,将每个锚点的连续求解率与匹配的总生成 词元预算 处的从头开始重新启动曲线进行比较。应用于 178 个问题模型单元(89 个数学问题 x 两个小型开放模型,一个结果盲但以难度为目标的队列),178 个单元中恰好有 1 个作为前缀限制幸存下来;重新启动剂量反应将计算匮乏的模型与能力有限的模型分开;无论匹配的预算位于重新启动网格内,继续模型自己的前缀都会击败重新启动(9 of 9)——主要是计算压缩而不是扩展可达性。其次,预先注册的难度控制测试在超出问题难度基线的早期窗口内部信号中没有发现可检测到的结果信息,并且对公共语料库的两次无生成分析表明了为什么需要这种控制:跟踪盲难度代理在 192K DeepSeek-R1 代上达到 AUROC 0.873(在已发布的探测范围内),并且对最接近的已发布早期窗口阳性进行紧密匹配的重建恢复了可比的汇总结果(0.849) 在问题范围内,它与所有 10 个锚点的概率在统计上无法区分(t=4 时为 0.496);事后目标内探测仅发现很小的平均残差,集中在三个低故障问题上。高池探针 AUROC 本身无法建立尝试内信息;需要仅问题基线或问题内评估。