论文

AsyncTool:多任务场景下异步函数调用能力评测

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

智能体系统Agent任务评测

摘要

基于大语言模型(LLM)的智能体在使用外部工具解决复杂任务方面已展现出强大能力。然而,现有评测往往忽视工具使用的时间维度,尤其是工具响应时延的影响,且通常局限于单任务设定。在真实应用中,多个任务常常需要并发执行,整体效率取决于智能体能否利用等待工具响应时的空闲时间。我们将这种能力称为异步工具调用。为对其进行评测,我们提出AsyncTool,一个在带有延迟工具反馈的交互式多任务工具使用环境中评估LLM智能体的基准。AsyncTool同时呈现多个异构任务,并在执行过程中模拟真实的工具响应时延。借助混合数据演化策略,我们构建了覆盖多种场景与工具使用模式的多样化异步多任务数据集。我们在步骤、子任务和任务三个层面评估模型,并引入面向效率的指标来衡量任务协调与完成效率。大量实验表明,延迟工具反馈给当前智能体带来实质性挑战,并导致明显的性能退化。能更好协调任务切换、依赖跟踪与状态维护的模型在AsyncTool上取得更强表现。我们的分析指出了当前工具使用智能体的关键失效模式,并为设计具备更强时间推理与协调能力的未来系统提供了实践启示。

AsyncTool:多任务场景下异步函数调用能力评测:论文配图
图 1:数据集构建过程概述。该管道首先从工具使用基准中收集原始数据,并按场景对其进行分类。任务步骤依赖性得到加强,并使用 Gemini 2.5 Pro 重建执行轨迹,然后手动验证准确性和确定性。最后,数据演化通过混合策略进行,并通过过滤生成最终的多任务数据集。