论文

ParaTool:将工具表示从上下文转移到参数

ParaTool: Shifting Tool Representations from Context to Parameters

智能体系统Agent 工具调用

摘要

工具调用通过使大语言模型(LLM)能够与外部可执行接口进行有依据的交互,从而扩展了LLM的能力,支持与环境耦合的问题求解。然而,主流的上下文学习(ICL)方法通常将详细的工具文档和使用示例直接放入上下文。随着上下文长度增长,这会带来可观的推理开销以及更高的幻觉风险。相反,基于微调的方法虽能提升通用工具调用能力,但往往无法有效内化先前见过的工具的具体细节,因而仍依赖上下文文档。为解决这些局限,我们提出ParaTool,一个将每个工具投影为一组专用、可加载参数的框架。通过动态装配这些参数化工具,LLM无需依赖上下文文档或示例即可执行工具调用。具体而言,我们的方法包含三个阶段:(1)参数化工具预训练,将不同工具的知识封装到独立的参数模块中;(2)软工具选择,利用门控网络动态加权并聚合相关工具参数;(3)参数化工具微调,联合更新工具参数以对齐训练与推理过程。在Stable ToolBench和BFCL上的实验表明,ParaTool显著优于强大的基于ICL的基线,在降低计算复杂度的同时取得更优性能。

ParaTool:将工具表示从上下文转移到参数:论文配图
图 2:我们提出的 ParaTool 的三阶段流程:(1)参数化工具预训练,其中每个工具独立地转换为相应的参数化表示; (2)软工具选择,训练门控网络来预测工具表示软组合的聚合权重; (3) 参数化工具微调,其中特定于工具的参数与预测权重联合微调,以协调训练和推理过程。