论文

耦合税:共享 词元预算 如何破坏固定产出限制下的可见思想链

The Coupling Tax: How Shared Token Budgets Undermine Visible Chain-of-Thought Under Fixed Output Limits

模型推理测试时计算扩展

摘要

思想链推理通常被视为通过让模型思考更长时间来提高语言模型准确性的单调方法。我们确定了一种抵消效应,即耦合税:当推理痕迹和最终答案共享一个输出 - 词元预算 时,长痕迹可能会挤出它们本应支持的答案。在 GSM8K、MATH-500 和三个尺度的 Qwen3 模型的五个 BIG-Bench 困难任务中,非思考模式在每个预算高达 2048 个词元的情况下与 GSM8K 和 MATH-500 上的思考模式相匹配或优于思考模式,而更困难的任务将交叉转移到更大的预算。我们推导了截断浪费分解 $\mathrm{Acc}_{\mathrm{think}}(b)=α_c F_L(b)+α_t(1-F_L(b))$,它根据链长和精度统计数据预测这种交叉,并解释了 Qwen 系列中的逆缩放。 DeepSeek-R1-Distill-Llama-8B 复制在不同的思维界面下显示了相同的模式。作为一种缓解措施,分割预算生成将推理和答案预算分离;在完整的 MATH-500 上,IRIS 达到 74.0% 的准确率,强化提取变体达到 78.8%,固定非预言机 SC+IRIS 门达到 83.6%。结果表明,测试时间推理应该被评估为预算分配问题,而不仅仅是更长的跟踪是否可用的问题。