论文

LLM Agent的行动空间塑造:测量和减轻工具模式偏差

Action-Space Shaping for LLM Agents: Measuring and Mitigating Tool-Schema Bias

智能体系统Agent 工具调用

摘要

当给定固定的工具模式时,大语言模型 (LLM) 在工具使用 agentic 任务中表现出强大的性能。然而,工具模式并不是Agent的操作空间;而是Agent的操作空间。它只是它的一种界面表示。相同的可执行操作可以通过许多不同的、功能等效的工具定义来公开,并且真正学习了任务的Agent应该在它们之间表现一致。我们发现当前的Agent通常不会这样做,我们将这种现象称为图式偏差。为了系统地研究这个问题,我们引入了一个可执行的转换框架,该框架使用九个运算符重写本机工具模式,包括合并和拆分工具、改变单个工具的表达方式以及在多个依赖调用之间分配一个操作。任务、可执行操作和可达状态保持固定,因此成功的任何变化都可单独归因于界面。我们对 11 个LLM(包括两个封闭模型)进行了多达 32 个模式变体的评估,我们询问模式偏差有多大、它是如何表现的、是否可以在没有全面评估的情况下预测模式变体的难度,以及训练是否可以消除它。我们发现,即使对于最新模型,模式偏差也很严重:成功率从完全失败到 97% 不等,仅取决于模式。为了可靠地估计模式难度,需要运行目标查询的小样本。仅当模式变体出现在训练数据中时,训练才会修复该变体。