论文
容量而非格式:重新思考结构化推理失败
Capacity, Not Format: Rethinking Structured Reasoning Failures
摘要
先前的工作将结构化输出视为推理税,但这种框架是不完整的:格式化的成本很大程度上取决于模型的闲置容量。使用信息匹配的散文控件和四级模式复杂度梯度,我们将 4 个模型和 5 个基准中的提示长度混淆与格式特定的影响分开,成功生成的响应的解析失败率为 0%。我们发现结构化格式依赖于容量。具有足够余量的模型可以吸收 JSON 约束而不会降级(Sonnet:$88.7\pm4.0$% JSON 与 MATH-Hard 上的 $89.3\pm1.7$% CoT)。相比之下,格式通过两种不同的机制严重降低了接近其极限运行的模型的性能。首先,在标准词元预算下,Haiku 下降了 36.2pp ($p < 0.0001$),主要是由于截断。其次,即使延长预算消除了截断,GPT-4o-mini 仍下降了 28.0pp ($p < 0.001$),揭示了与词元耗尽无关的纯粹容量竞争。这种格式损失与模式复杂性 (McNemar $p < 0.0001$) 成比例,并且不能仅通过提示长度来解释。此外,这些结果证明了前沿模型免疫力的主张:在 AIME 竞赛数学中,Opus 4.7 在 JSON 下从 96.2% 下降到 91.0%($-5.3$pp;显示的百分比是独立舍入的,确切的差异是 $7/133 = 5.26$pp $\approx 5.3$pp)。延迟结构消融——在格式化之前自由推理——恢复了大部分丢失的准确性(3次运行平均值:80--87%),支持容量竞争机制。实际意义不是要避免结构化输出,而是要使其与容量相匹配:当模型接近其极限时,先思考,然后格式化。