论文
AsyncTool:多任务场景下异步函数调用能力评测
AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios
摘要
基于大语言模型(LLM)的智能体在使用外部工具解决复杂任务方面已展现出强大能力。然而,现有评测往往忽视工具使用的时间维度,尤其是工具响应时延的影响,且通常局限于单任务设定。在真实应用中,多个任务常常需要并发执行,整体效率取决于智能体能否利用等待工具响应时的空闲时间。我们将这种能力称为异步工具调用。为对其进行评测,我们提出AsyncTool,一个在带有延迟工具反馈的交互式多任务工具使用环境中评估LLM智能体的基准。AsyncTool同时呈现多个异构任务,并在执行过程中模拟真实的工具响应时延。借助混合数据演化策略,我们构建了覆盖多种场景与工具使用模式的多样化异步多任务数据集。我们在步骤、子任务和任务三个层面评估模型,并引入面向效率的指标来衡量任务协调与完成效率。大量实验表明,延迟工具反馈给当前智能体带来实质性挑战,并导致明显的性能退化。能更好协调任务切换、依赖跟踪与状态维护的模型在AsyncTool上取得更强表现。我们的分析指出了当前工具使用智能体的关键失效模式,并为设计具备更强时间推理与协调能力的未来系统提供了实践启示。
