论文

面向LLM工具使用的自适应推理与执行的案例式校准

Case-Based Calibration of Adaptive Reasoning and Execution for LLM Tool Use

模型训练强化学习Agentic RL

摘要

工具使用把大语言模型的能力扩展到参数化知识之外,但可靠执行需要在恰当的推理深度与严格的结构有效性之间取得平衡。我们从基于案例的视角切入,提出CAST——一个把历史执行轨迹视为结构化案例的案例驱动框架。CAST不复用原始示例输出,而是提取源自案例的信号:识别用于估计最优推理策略的复杂度画像,以及用于映射可能结构性故障的失败画像。该框架把这些知识转化为细粒度奖励设计与自适应推理,使模型能在强化学习过程中自主内化基于案例的策略。在BFCLv2与ToolBench上的实验表明,CAST同时提升了忠实于模式的执行与任务级工具使用成功率,并减少了不必要的深思。该方法整体执行准确率最高提升5.85个百分点,平均推理长度缩短26%,显著缓解高影响的结构性错误。这最终表明,历史执行案例可以为经校准的工具使用提供可复用的适配知识。

面向LLM工具使用的自适应推理与执行的案例式校准:论文配图
图1:有无比案例库机制的推理工作流对比:案例校准用于自适应推理与执行策略。