论文

PeakBench:面向LLM智能体资源感知工具调用的基准测试

PeakBench: Benchmarking Resource-Aware Tool Invocation in LLM Agents

智能体系统Agent任务评测

摘要

LLM智能体越来越多地通过调用多个工具来完成任务,其中并行执行对低延迟至关重要,但难以安全管理。现有智能体基准主要在以串行执行为主的设置下评估工具选择、参数生成与端到端成功率,很大程度上忽视了有效的并行化与资源受限调度。这一调度维度的缺失造成一种实际的失败模式:串行执行安全但缓慢,而不顾资源的并行执行快速但容易发生本可避免的资源溢出。为填补这一空白,我们提出PeakBench,一个由可执行多工具工作流构成的基准,带有基于执行依据的依赖标注与实测的资源特征。评估此类工作流的一个核心挑战是归因:失败与低效可能源于错误的依赖规划、糟糕的资源受限调度,或两者兼有。PeakBench用一个两部分评估框架应对这一挑战,将逻辑规划与物理调度解耦,并为每个维度设置专门指标。利用该框架,我们表明强大的逻辑规划并不能可靠地转化为资源约束下安全或高效的执行。我们进一步表明,暴露资源信息可以减少可避免的溢出并提升资源利用率,使PeakBench成为诊断资源感知智能体行为的有用测试床。代码可在 https://github.com/Czzzk/Staggering-the-Peaks 获取。

PeakBench:面向LLM智能体资源感知工具调用的基准测试:论文配图
图2:PeakBench数据集构建流程。左:以基准为种子的工作流合成,采样MCP工具并生成可执行的多工具查询。中:沙箱执行观察步骤级行为并验证步骤间关系。右:执行顺序扰动恢复前提与并发结构,供两个基准维度使用。