论文
PruneTIR:推理时间工具调用修剪,实现有效且高效的工具集成推理
PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning
摘要
工具集成推理 (TIR) 使 大语言模型 (LLM) 能够通过与代码解释器 (CI) 等外部工具交互来增强其能力。最近的研究重点是探索各种方法来为 LLM 配备使用工具的能力。然而,如何在推理时进一步提高已经具备工具能力的 LLM 的推理能力仍有待探索。在推理时提高推理能力不需要额外的训练,并且可以帮助 LLM 更好地利用工具来解决问题。我们观察到,在工具支持的 LLM 推理过程中,错误工具调用的数量和比例与答案正确性呈负相关。此外,错误的工具调用通常会在随后的几个回合内成功解决。如果没有,LLM 通常很难解决此类错误,即使有很多额外的转弯。基于上述观察,我们提出了 PruneTIR,这是一个相当有效且高效的框架,可以增强推理时的工具集成推理。在 LLM 推理期间,PruneTIR 通过三个组件修剪轨迹、重新采样工具调用并暂停工具使用:成功触发的修剪、卡住触发的修剪和重新采样以及重试触发的工具暂停。这三个组件使 PruneTIR 能够减轻错误工具调用的负面影响,并防止 LLM 陷入重复失败的解决尝试中,从而提高 LLM 的整体性能。大量实验结果证明了 PruneTIR 的有效性,它显着提高了 Pass@1 和效率,同时减少了支持工具的 LLM 的工作上下文长度。