论文
大语言模型 中关于具有显式有效性约束的有限离散状态空间问题的复杂性引起的极限的经验证据
Empirical Evidence of Complexity-Induced Limits in Large Language Models on Finite Discrete State-Space Problems with Explicit Validity Constraints
摘要
大语言模型 (LLM) 越来越多地被描述为拥有强大的推理能力,并得到数学、逻辑和规划基准的高性能支持。然而,大多数现有的评估依赖于固定数据集的总体准确性,模糊了推理行为如何随着任务复杂性的增加而演变。在这项工作中,我们引入了一个受控基准测试框架,以系统地评估大型推理模型(LRM)在问题复杂性逐渐增加的情况下推理的稳健性。我们构建了一套包含九个经典推理任务的套件:布尔可满足性、密码学、图形着色、过河、河内塔、水壶、跳棋、数独和魔方,每个任务都经过参数化以精确控制复杂性,同时保留底层语义。使用确定性验证器,我们评估低、中、高复杂度体系中的多个开放和专有 LRM,确保只接受完全有效的解决方案。我们的结果揭示了一致的相变行为:模型以低复杂性实现了高精度,但急剧下降超出了任务特定的复杂性阈值。我们将这种现象形式化为推理崩溃。在各个任务中,我们观察到准确率大幅下降,通常超过 50%,并伴随着推理轨迹不一致、违反约束、状态跟踪丢失以及自信的错误输出。增加推理长度并不能可靠地提高正确性,并且一个问题族中的收益也不能推广到其他问题族中。这些发现强调了评估方法的必要性,这些方法超越静态基准,并在受控复杂性下明确衡量推理的稳健性。