论文

思考需要令牌:何时更强的结构值得付出成本

Thinking Costs Tokens: When More Structure is Worth the Price

模型推理测试时计算扩展

摘要

向语言模型添加推理结构可以使其进行搜索、验证和修改,但这些操作消耗了它们应该充分利用的预算。在本文中,我们研究是否存在token预算阈值,低于该阈值,规划和验证的开销会损害性能,高于该阈值,则会有所帮助。我们使用 GPT-5.4 mini 评估了 FinQA 和 TAT-QA 财务推理任务上的两个系统,涵盖 14 个预算等级,范围从 250 到 42,000 个输出等价token。第一个系统是一个整体系统,它是一个单一的 LLM 调用。第二个是经过验证的搜索架构,增加了规划、标签盲检查和修复功能。我们运行了 1,000 个案例,总共 28,000 个已完成的单元。两个系统在两个最低级别的得分都是 0%,都无法满足完整的提示。在 1,000 个令牌时,整体的准确率达到 18%,而验证的搜索分数接近 0%,因为规划开销没有留下答案的空间。从 1,500 个token开始,经过验证的搜索超过了整体式搜索并保持一致的优势,在最高层达到约 44%,而整体式则达到约 40%。交叉发生在 1,000 到 1,500 个输出等价令牌之间,通过严格的交集并集测试确认(两个端点处的 $p \le 0.001$)。

思考需要令牌:何时更强的结构值得付出成本:论文配图
图1:按系统和预算层级分列的准确性。在1000个标记上, 蓝色( blue) 以18% 领先, 而经核实的搜索分数接近0% 。从1 500个经核实的搜索(绿色)到整个系统,两个系统都在不断改善,在2000年的t4时分别达到40%和44%。错误栏显示1,000个案例的标准错误 。