论文
价格反转现象:当更便宜的推理模型成本更高时
The Price Reversal Phenomenon: When Cheaper Reasoning Models Cost More
摘要
开发人员和消费者越来越多地根据列出的 API 价格选择推理模型 (RM)。然而,这些价格如何准确地反映实际的推理成本?我们对这个问题进行了首次系统研究,评估了 12 个不同任务中的 8 个前沿 RM,涵盖竞赛数学、科学 QA、代码生成和多域代理。我们发现了定价反转现象:在 32% 的车型对比较中,标价较低的车型实际上会产生较高的总成本,反转幅度高达 28 倍。例如,Gemini 3 Flash 的标价比 GPT-5.4 便宜 80%,但其所有任务的实际成本却高出 38%。我们基于 Shapley 值构建了一个正式的成本归因框架,并利用它来追踪思维词元消耗和交互次数的巨大异质性的主要贡献者:在同一查询上,一个模型可能比另一个模型使用多 900% 的思维词元,或者环境交互次数多 10 倍。我们进一步表明,每个查询的成本预测从根本上来说是困难的:重复运行相同的查询会产生高达 9.7 倍的思维标记变化,从而为任何预测器建立了不可减少的噪声基底。因此,我们提出成本分布预测作为一项公开挑战。我们的研究结果表明,列出的 API 定价并不能可靠地反映实际成本,因此需要选择具有成本意识的模型并进行透明的每个请求成本监控。