论文

人体与DeepSeek-R1 LLM数学推理的全面解剖

A Comprehensive Anatomy of Human and DeepSeek-R1 LLM Mathematical Reasoning

模型评测模型行为与机制分析

摘要

大语言模型(特别是 DeepSeek-R1-0120)中“啊哈时刻”的出现提出了这样的问题:这些系统是否真正进行推理,或者只是模仿推理的外观。我们对 AIME 2025 的所有 30 个问题进行了模型推理和人类推理的全面实证比较,将 10,247 个推理步骤详尽地注释为五个功能类别:分析、推理、分支、回溯和反射。我们发现了明显的结构差异。人类解决方案在分析和演绎之间保持紧凑的交替​​,而 DeepSeek-R1 经常重新访问中间结果,执行浅层且通常不必要的验证,并循环进行本地检查,而没有有意义的逻辑进展。我们将其描述为拓扑拟态:再现推理的表面形式,而不具有其功能作用。尽管如此,我们还是发现了两个真正推理的信号。首先,成功的跟踪表现出分支和回溯的稳定使用,而失败的跟踪要么未充分使用或过度使用探索性操作。其次,反思只有在演绎推理中才有效。分析循环中的反射集中于局部数字细节,而忽略了全局逻辑错误。这些发现表明,当前的长 CoT 模型可能因推理的出现而不是真正的演绎进展而获得更多奖励。我们讨论了改进评估和训练的方向,包括测量跨迹线稳定性、惩罚“旋转轮”迹线、鼓励更深入的逻辑校正以及重新分配推理时间计算以进行推论和回溯。总体而言,推理质量不仅取决于反思发生的次数,还取决于反思是否一致且以适当的逻辑尺度出现。