论文
思考需要令牌:何时更强的结构值得付出成本
Thinking Costs Tokens: When More Structure is Worth the Price
摘要
向语言模型添加推理结构可以使其进行搜索、验证和修改,但这些操作消耗了它们应该充分利用的预算。在本文中,我们研究是否存在token预算阈值,低于该阈值,规划和验证的开销会损害性能,高于该阈值,则会有所帮助。我们使用 GPT-5.4 mini 评估了 FinQA 和 TAT-QA 财务推理任务上的两个系统,涵盖 14 个预算等级,范围从 250 到 42,000 个输出等价token。第一个系统是一个整体系统,它是一个单一的 LLM 调用。第二个是经过验证的搜索架构,增加了规划、标签盲检查和修复功能。我们运行了 1,000 个案例,总共 28,000 个已完成的单元。两个系统在两个最低级别的得分都是 0%,都无法满足完整的提示。在 1,000 个令牌时,整体的准确率达到 18%,而验证的搜索分数接近 0%,因为规划开销没有留下答案的空间。从 1,500 个token开始,经过验证的搜索超过了整体式搜索并保持一致的优势,在最高层达到约 44%,而整体式则达到约 40%。交叉发生在 1,000 到 1,500 个输出等价令牌之间,通过严格的交集并集测试确认(两个端点处的 $p \le 0.001$)。
