论文
思维的几何:规模如何重构大语言模型中的推理
The Geometry of Thought: How Scale Restructures Reasoning In Large Language Models
摘要
规模并非均匀地改进推理——它重构推理。通过分析四个领域(法律、科学、代码、数学)、两个规模(8B、70B 参数)的 25000 多条思维链轨迹,我们发现神经缩放定律触发领域特定的相变,而非一致的能力增益。法律推理经历结晶化(Crystallization):表征维度坍缩 45%(d95: 501 -> 274)、轨迹对齐增加 31%、流形解开 10 倍。科学与数学推理保持液态(Liquid)——尽管参数增加 9 倍,几何却保持不变。代码推理形成战略模式的离散晶格(Lattice)(silhouette: 0.13 -> 0.42)。这种几何可预测可学习性。我们引入神经推理算子(Neural Reasoning Operators)——从初始隐状态到终止隐状态的学习映射。在结晶化的法律推理中,我们的算子通过探针解码在留存任务上达到 63.6% 的准确率,无需遍历中间状态即可预测推理终点。我们还发现一个跨领域与规模不变的普遍振荡特征(coherence ~ -0.4),提示注意力层与前馈层通过相反的动力学驱动推理。这些发现确立:思维的成本不是由任务难度而是由流形几何决定——为拓扑允许之处的推理加速提供蓝图。
