论文
复杂度天花板基准:深度扩展下顺序推理的多域评估
The Complexity Ceiling Benchmark: A Multi-Domain Evaluation of Sequential Reasoning Under Depth Scaling
摘要
我们介绍复杂度天花板基准(CCB)——语言模型推理随所需顺序步数增长如何衰减的受控评估。CCB固定任务的语义内容——仅在三个结构不同机制中变化其深度N∈{5,...,50}:锚定空间状态追踪、抽象符号指针操作与传递关系推理。跨五模型(前沿与开放权重)6,000次试验——我们发现一致的每步几何衰减模式与相距悬殊的域天花板:前两个机制中最强模型在N=50保持pd>0.92;第三个机制中所有模型在N=5即崩塌——最佳模型的50%成功视界H0.5约4.7步(尽管pd=0.863)。踪迹级指标(TFBC)显示基准内14.5%的正确答案是经错误中间推理到达的。强制冗长状态追踪不移动天花板(McNemar p=1.000)——而推理首次发散的平均步k*比参数量更好地预测域内准确率。CCB与几何衰减模型一起把模型的长程推理画像压缩为每任务族一个可解释数字。