论文

调用还是不调用:一个评估与优化LLM工具调用的框架

To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling

智能体系统Agent 工具调用

摘要

代理人工智能架构通过外部工具增强大语言模型,释放强大的功能。然而,工具的使用并不总是有益的。有些调用可能是多余的,甚至是有害的。因此,有效的工具使用取决于大语言模型的核心决策:在执行任务时是否调用工具。这一决定对于网络搜索工具来说尤其具有挑战性,其中外部信息的好处取决于模型的内部知识及其集成潜在噪声工具响应的能力。我们引入了一个受决策理论启发的原则框架,根据三个关键因素评估网络搜索工具的使用决策:必要性、实用性和可承受性。我们的分析结合了两个互补的视角:规范性视角,从工具调用的最佳分配中推断真实需求和效用;描述性视角,从观察到的行为推断模型的自我感知需求和效用。我们发现模型对工具调用的感知需求和效用常常与其真实需求和效用不一致。在此框架的基础上,我们根据模型的隐藏状态训练轻量级的需求和效用估计器。我们的估计器支持简单的控制器,可以提高决策质量,并比三个任务和六个模型的自我感知设置带来更强的任务性能。

调用还是不调用:一个评估与优化LLM工具调用的框架
图 1:给定输入 x x ,模型 ℳ \mathcal{M} 决定 π ⁡ ( x ) ε { 0 , 1 } \pi(x)\in\{0,1\} 是否调用工具(响应 r r ),生成 y = ℳ ⁡ ( x , r ) y=\mathcal{M}(x,r) 或 y = ℳ ⁡ ( x ) y=\mathcal{M}(x) 。我们比较“无工具”、“总是工具”和“自我决策”,并通过需求(需要帮助)、效用(性能增益)和承受能力(成本与收益)来评估决策,区分感知数量与真实数量。