论文

思考的代价:作为模型特定API契约的推理努力

The Price of Thinking: Reasoning Effort as a Model-Specific API Contract

模型评测模型能力评测

摘要

API买家购买的是一份带日期的契约,而不仅是模型名称:契约包括请求的与实际服务的模型、推理努力(reasoning-effort)条款或其省略、输出轨道、服务产品、提示和价格表。我们通过一项预注册的配对对照研究推理努力条款:将Sonnet 5显式高努力与同一模型省略努力的设置进行对比,使用30道AIME 2026题目、每题五次调用。每个付费尝试都被分配一个冻结的终末类别,推理在保留重复调用的同时对题目重采样。显式高努力契约下平均交付成本比省略契约每调用高0.01031美元 [+0.00204, +0.01974]。相应的准确率对比为+0.0133 [-0.0267, +0.0467];我们没有检测到准确率差异,且该区间允许最高4.67个百分点的增益,这一设计无法排除。每个正确答案的成本在高努力契约下为0.08665美元,在省略契约下为0.07662美元,均为预注册点估计。一份带日期的契约普查、Models-API元数据以及预注册的原始响应探针进一步记录了模型特定的省略语义,包括同一提供商内部;当原始结构不确定时,相关声明保持在文档级别。请求注册表、解析器、终末分类、统计计划和分析流水线在检查结果之前均已冻结;所得声明限定于所研究的模型、任务和采集日期。