论文

DecisionBench:长程智能体工作流中涌现式委派的基准

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

智能体系统Agent HarnessAgent任务评测长程任务评测

摘要

我们提出DecisionBench,一个面向长程智能体工作流中涌现式委派的基准基底。该基底固定了一个任务套件(GAIA、tau-bench、BFCL多轮)、一个对等模型池(11个模型、7个厂商家族)、一个委派接口(call_model加上可选的read_profile通道)、一个确定性的技能标注层,以及一套多轴指标,涵盖质量、成本、延迟、委派率、top-k路由保真度、厂商自我偏好和反事实委派上限。该基底不依赖对等信息如何生成或交付,因此学习型路由器、更丰富的对等记忆、自适应画像构建和多步委派都可以对照它进行评估。我们通过对完整模型池的五条件参考扫描(n=23,375个任务实例)来刻画该基底。三个基准层面的发现浮现:(i) 四种感知条件下的平均端任务质量在统计上不可区分(|beta| <= 0.010,p >= 0.21),因此只看质量的评估会错过编排信号;(ii) 在平均质量接近相等的情况下,各条件的top-1路由保真度在7.5%到29.5%之间变化,其中交付通道(按需工具调用对比预载描述)的影响超过描述内容本身;(iii) 反事实上限表明完美委派在每个套件上都比实测性能高15-31个百分点,为未来编排方法标示出巨大的未实现空间。我们发布了基底、标注层、参考干预套件、分析流水线以及220份按条件归档的运行记录。

DecisionBench:长程智能体工作流中涌现式委派的基准:论文配图
图 1:DecisionBench 概述。左(基材,§3)。该基准修复了一个任务套件(GAIA、τ\tau-bench、BFCL 多轮)、一个对等模型池(11 个模型、7 个供应商系列)、一个委托接口(call_model,加上一个可选的 read_profile 通道)、一个注释层(冻结 7 种技能分类和确定性步骤标记器;App.C)和一个指标套件(质量、成本、延迟、委托率、保真度 at-kk、自我偏好、反事实上限)。正确(参考干预措施,§4)。为了演示底层,第一阶段分裂的同行轨迹被呈现为三个配置文件卡变体(C1 标题、C2 确定性统计、C3 双 LLM 法官);每个都用作感知条件下的预加载描述。交付通道消融(仅限感知工具)公开 read_profile,无需预加载任何描述,从而将交付与内容隔离。这五个条件为未来的编排方法进行比较,但不是基准定义的一部分。