论文
DuMateBench:在复杂真实世界工作流中评估自主智能体
DuMateBench: Evaluating Autonomous Agents in Complex Real-World Workflows
摘要
自主智能体正被越来越多地用于完成真实环境中的复杂多工具工作流。然而,现有基准通常按应用或能力划分任务,并在比实际更干净、更稳定的环境中评估智能体。我们提出DuMateBench,一个从大规模生产级智能体平台收集的匿名化、隐私筛查后的用户会话重建的真实会话基准。每个任务保留解题前相关的交互历史、持久配置和工作区状态,并经人工验证确认。由此得到的基准包含200个任务,横跨8个宽泛场景和17个细粒度能力类别,其中大多数任务需要多种能力协同。我们在注入三种真实环境复杂性的隔离Docker容器中执行这些任务:资源不足(Insufficient)、不稳定(Unstable)和噪声(Noisy),并采用确定性与LLM-as-Judge混合评估协议评估性能。在五个代表性自主智能体框架与四个最先进LLM组合上的实验揭示了严格任务完成度上的巨大差距。补充的鲁棒性、效率和诊断分析进一步表明,环境扰动下的表现由LLM能力与周围的智能体框架共同塑造。代码与数据已在 https://dumatebench.com/ 公开。