论文

UniToolCall:统一LLM智能体的工具使用表示、数据与评估

UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents

智能体系统Agent 工具调用

摘要

工具使用能力是LLM智能体的基础组件,使其能够通过结构化函数调用与外部系统交互。然而,现有研究的交互表示不一致,很大程度上忽视了工具使用轨迹的结构分布,并依赖互不兼容的评估基准。我们提出UniToolCall,一个工具学习统一框架,将从工具集构建、数据集生成到评估的整个流水线标准化。该框架整理了包含超过22k工具的大型工具池,并将10个标准化公开数据集与结构受控的合成轨迹相结合,构建了超过390k实例的混合训练语料。它显式建模多样的交互模式,包括单跳与多跳、单轮与多轮,同时捕捉串行与并行两种执行结构。为支持连贯的多轮推理,我们进一步引入Anchor Linkage机制来强制跨轮依赖。此外,我们将7个公开基准转换为统一的查询-动作-观察-回答(Query--Action--Observation--Answer,QAOA)表示,并在函数调用、轮次和对话三个层级上进行细粒度评估。实验表明,在我们的数据集上微调Qwen3-8B可显著提升工具使用性能。在干扰项众多的Hybrid-20设置下,取得93.0%的单轮Strict Precision,超越GPT、Gemini和Claude等商用模型。

UniToolCall:统一LLM智能体的工具使用表示、数据与评估:论文配图
图 1:现有数据集受到碎片问题的严重限制。为了应对这些挑战,UniToolCall 引入了一个标准化框架,该框架提供了强大的结构约束,在强大的基线上产生了 SOTA。