论文

广度推理而非深度推理:把推理溢价摊销进蒸馏技能

Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills

智能体系统Agent Skills

摘要

语言模型的推理模式在多步agentic任务上优于非推理对应版本,但每个回合要支付3-6倍的输出token溢价——其中很大一部分花费在重复推导同一领域各回合之间共享的流程上。我们证明这种反复发生的成本可以被摊销:一个编码智能体分析来自训练划分的少量现有轨迹语料,编译出一个紧凑的自然语言技能,注入非推理模型的系统提示词。在四个agentic基准(ALFWorld、tau$^2$-bench telecom与retail、以及SpreadsheetBench-Verified)上,技能在留出任务上为GPT-5.4-mini恢复了55%-100%以上的推理差距——其中两个基准上甚至完全超过推理模式——同时输出token减少2.7-6倍,且推理token为零。值得注意的是,推理轨迹并非前提:仅从非推理轨迹蒸馏的技能仍可与从配对推理/非推理语料蒸馏的技能相竞争,两种来源之间存在依赖领域的差异。我们通过搜索视角解读这些结果:测试时推理是单个回合内的深度搜索,在每次部署时都要重新付费;而语料蒸馏是跨回合的广度搜索,只需付费一次。二者恢复的流程性知识相互重叠,而在廉价轨迹上做广度往往是更划算的选择——某些领域(telecom、SpreadsheetBench)上的残差差距划定了真正需要逐实例深度搜索的边界。

广度推理而非深度推理:把推理溢价摊销进蒸馏技能:论文配图
图2:ALFWorld任务——(“put a cool tomato in microwave”)。有/无技能的非推理模型对比。没有技能时,模型从不冷却番茄,并在look上循环直至步数上限(左);有技能时,模型发出cool tomato 1 with fridge 1并完成(右)。内容逐字摘自rollout。