论文

Ares:面向高效LLM智能体的自适应推理努力选择

Ares: Adaptive Reasoning Effort Selection for Efficient LLM Agents

模型推理测试时计算扩展

摘要

由思考型LLM驱动的现代智能体通过长思维链推理获得高准确率,但产生可观的推理成本。尽管许多LLM现在支持可配置的推理档位(如高/中/低),静态策略往往无效:每一步都用低努力模式会导致显著的性能下降,而随机选择既不能保住准确率也无法带来有意义的成本削减。然而,智能体应把高推理努力留给导航复杂网站结构等困难步骤,而在打开目标URL等较简单步骤上使用较低努力档位。本文提出Ares,一个为多步智能体任务量身定制的逐步动态推理努力选择框架。Ares采用轻量级路由器,基于交互历史为每一步预测最低的适当推理档位。为训练该路由器,我们开发了数据生成流水线,识别成功完成每一步所需的最低推理努力。随后微调路由器以预测这些档位,实现对任意LLM智能体的即插即用集成。我们在多样化的智能体任务上评估Ares,包括工具使用智能体的TAU-Bench、深度研究智能体的BrowseComp-Plus和网页智能体的WebArena。实验结果表明,与固定高努力推理相比,Ares最多减少52.7%的推理token用量,同时任务成功率仅有极小下降。

Ares:面向高效LLM智能体的自适应推理努力选择:论文配图
图 1:自适应推理努力选择 (ARES) 框架概述。左图:传统模型路由在没有 KV 缓存重用的情况下通常会产生额外的推理成本。中:我们提出的 Ares 框架在每一步动态分配推理工作。右图:与基准相比,Ares(红星)在性能和成本之间实现了最佳平衡。