论文

用推理技能思考:更少token,更高准确率

Thinking with Reasoning Skills: Fewer Tokens, More Accuracy

摘要

推理型LLM在解决新问题时常常在冗长的中间推理轨迹(例如思维链)上花费大量token。我们提出将从大量深思与试错探索中提炼出的可复用推理技能进行总结和存储,并在推理时检索这些技能以引导后续推理。与主流的从零推理(reasoning from scratch)范式不同,我们的方法首先为每个查询召回相关技能,帮助模型避免冗余弯路并聚焦有效的解题路径。我们在编程与数学推理任务上评估该方法,发现它显著减少了推理token,同时提升了整体性能。由此带来的每请求成本下降表明其在真实部署中具有强劲的实践与经济潜力。

用推理技能思考:更少token,更高准确率:论文配图
图 17:使用 AoPS 衍生技能库进行外部竞赛数学转移。左:TRS 减去直接精度增量。中:TRS 减去直接成本增量,以相对于直接成本的百分比表示。右:模型级平均准确度/成本百分比权衡。总体模式是混合的:25 对中的 13 对提高了准确性,25 对中的 20 对降低了成本。