论文
AutomationBench
摘要
现有的软件自动化AI基准很少同时涵盖跨应用协调、自主API发掘与策略遵循三个方面。真实的业务工作流对三者都有要求:单个任务可能横跨CRM、收件箱、日历和消息平台——要求智能体找到正确的端点、遵循政策文件,并把正确的数据写入各个系统。为填补这一空白,我们提出AutomationBench,一个通过REST API评估AI智能体跨应用工作流编排能力的基准。任务取材于Zapier平台上的真实工作流模式,覆盖销售、营销、运营、支持、财务与人力资源等领域。智能体必须自行发现相关端点、遵循分层业务规则,并在包含无关记录乃至误导性记录的环境中穿行。评分是程序化的、只看最终状态:正确的数据是否最终落入了正确的系统。目前即便是最好的前沿模型得分也低于10%。AutomationBench提供了一个有挑战性且贴近现实的标尺,用以衡量当前模型相对于企业实际所需的智能体能力处于什么位置。
