论文
推理税:LLM推理跨任务类型与部署环境的Token经济学
The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts
摘要
仅以准确率为准的基准测试忽视了推理型大语言模型的一个核心部署问题:扩展思考token何时能赚回其成本?我们提出Token Economy Score(TES),一个边际基准指标,衡量推理模型相对非推理基线的准确率增益,并以生成token倍数归一化。对带推理开关的模型族,我们定义了成对TES变体;对没有直接非推理对应版本的前沿模型,定义了近似TES变体。随后我们在七个基准上开展实证基准分析,共151次模型-基准评估运行,覆盖数学、代码生成、科学推理、指令遵循、专家知识、知识回忆和研究级物理。分析考察三个面向部署的维度:哪些任务结构带来正的边际推理效率;在同一模型族内提高推理努力(reasoning effort)如何改变TES;以及部署环境如何改变经济可行性。结果显示,任务结构比名义难度更能预测推理效率:AIME 2025和LiveCodeBench等序列推理链任务表现出高TES,而MMLU-Pro等知识回忆类任务虽然困难却TES低。我们还发现更高推理努力水平下存在系统性收益递减,包括额外思考反而降低准确率的情形。最后,Reasoning Cost Share(RCS)表明推理开销常由内部思考主导,而Deployment Cost Multiplier(DCM)表明本地化部署可以改变原本昂贵的推理工作负载的经济性。这些发现支持一条基于基准测试的模型选择规则:按任务类型、努力水平和部署环境选择性地启用推理,而不是将其视为普遍有益的模式。