论文
模式识别与逐步推理之间的关系
The Dichotomy Between Pattern Recognition and Step-by-Step Reasoning
摘要
我们认为模式识别和逐步推理是一个范围的两端。当数据被结构化时,大型语言模型 (LLM) 会逐步学习推理,使得下一个标记依赖于少量的先前上下文。当下一个标记依赖于大量先前的上下文时,LLM中的推理类似于模式识别。如果下一个标记仅依赖于 $c$ 最近的标记,则推理轨迹是 De Bruijn 图上的路径,其节点是 $c$ 长度的上下文,边是上下文之间的下一个标记转换。任务的推理轨迹集形成 De Bruijn 图的有向非循环子图。学习了该子图所有边的LLM可以组合它们来解决更长的、看不见的任务,即逐步推理。我们证明,与推理轨迹的数量相比,边的数量少得可怜。根据经验,Transformer所需的训练样本数量是边数的幂律,因此逐步学习推理是样本有效的。我们可以通过维持一种使未来推理独立于过去的“状态”来在任何任务中引入德布鲁因结构。推理轨迹中的状态频率决定了$c$。我们通过微调 Qwen2.5-1.5B-Instruct 来求解方程并回答有关故事的问题,结果表明,频繁的状态(小 $c$)会带来更高的准确性,但在测试时对扰动的脆弱性更大。用大量 $c$ 训练的LLM只能与无需推理即可执行模式识别的模型一样好。中等密度的状态平衡了准确性和鲁棒性。我们证明现实世界的数据具有 De Bruijn 结构:当注意力被限制在小于 15% 的滑动窗口(只要完整的推理轨迹)时,Qwen3-14B 和 Qwen3-32B 在 GSM8K、MATH-500 和 GPQA-Diamond 上保留了超过 75% 的准确性。