论文
DecisionBench:长程智能体工作流中涌现式委派的基准
DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows
摘要
我们提出DecisionBench,一个面向长程智能体工作流中涌现式委派的基准基底。该基底固定了一个任务套件(GAIA、tau-bench、BFCL多轮)、一个对等模型池(11个模型、7个厂商家族)、一个委派接口(call_model加上可选的read_profile通道)、一个确定性的技能标注层,以及一套多轴指标,涵盖质量、成本、延迟、委派率、top-k路由保真度、厂商自我偏好和反事实委派上限。该基底不依赖对等信息如何生成或交付,因此学习型路由器、更丰富的对等记忆、自适应画像构建和多步委派都可以对照它进行评估。我们通过对完整模型池的五条件参考扫描(n=23,375个任务实例)来刻画该基底。三个基准层面的发现浮现:(i) 四种感知条件下的平均端任务质量在统计上不可区分(|beta| <= 0.010,p >= 0.21),因此只看质量的评估会错过编排信号;(ii) 在平均质量接近相等的情况下,各条件的top-1路由保真度在7.5%到29.5%之间变化,其中交付通道(按需工具调用对比预载描述)的影响超过描述内容本身;(iii) 反事实上限表明完美委派在每个套件上都比实测性能高15-31个百分点,为未来编排方法标示出巨大的未实现空间。我们发布了基底、标注层、参考干预套件、分析流水线以及220份按条件归档的运行记录。
