论文

任务的能力上限:Transformer何时无需思维链也能成功?

Ceiling of a Task: When Can a Transformer Succeed Without Its Chain of Thought?

模型评测模型行为与机制分析

摘要

推理模型在给出答案之前会产生长长的思维链,但这些链的内容是真正的计算工作还是主要是装饰性的,仍存在争议。我们通过将Transformer视为浅电路来研究这个问题。通过固定层数的一次前向传递具有恒定的深度,因此任何运行模型恒定次数的过程都是浅层电路。我们将浅层电路在任务上可以达到的最佳精度称为任务的上限,如果任务的上限低于 1,则任务是串行的。我们证明了串行任务的三个结果适用于每个Transformer,无论它是如何训练的。必要性:用任何不依赖于其内容的东西替换链,例如填充词元或问题的重述,将准确性降低到上限,并将最大串行任务降低到偶然性。深度:任何浅层计算都无法写出精度超过上限的模型链,甚至不能近似。局部性:答案是距完成的链一个浅层传递,因此所有串行推理都发生在链中。在有限群的文字问题上,其上限是已知的,从头开始训练的小型Transformer,无论是否有强化学习,都获得了预测的数字:链训练模型解决了每个输入长度,并在链被删除时陷入偶然,无链模型随着输入长度的增长而崩溃到上限,而开放权重推理模型在给出相同的单词问题时返回到没有链的基线。在 MATH-500 和 AIME 上,擦除链会花费开放推理模型 0.52 到 0.82 的准确度,句子洗牌是无害的,词元洗牌与擦除一样有害;这同样适用于 GRPO 使用正确或随机奖励训练的检查点。因此,任务的上限回答了Transformer何时可以在没有其思维链的情况下成功。