论文

Claw-Eval-Live:不断发展的现实世界工作流程的实时代理基准

Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

智能体系统Agent任务评测

摘要

LLM 代理预计将完成跨软件工具、业务服务和本地工作空间的端到端工作单元。然而,许多代理基准测试会在发布时冻结策划的任务集,并主要对最终响应进行评分,这使得根据不断变化的工作流需求评估代理或验证任务是否已执行变得困难。我们推出了 Claw-Eval-Live,这是一个工作流代理的实时基准测试,它将可刷新的信号层(跨版本更新的公共工作流需求信号)与可重现的带时间戳的发布快照分开。每个版本都是根据公共工作流程需求信号构建的,并使用当前版本中使用的 ClawHub Top-500 技能,并具体化为具有固定固定装置、服务、工作空间和分级机的受控任务。对于评分,Claw-Eval-Live 记录执行跟踪、审核日志、服务状态和运行后工作区工件,在证据充足时使用确定性检查,并仅针对语义维度进行结构化 LLM 判断。该版本包含 105 项任务,涵盖受控业务服务和本地工作区修复,并在共享公共通行证规则下评估 13 个前沿模型。实验表明,可靠的工作流程自动化还远未得到解决:领先的模型仅通过了 66.7% 的任务,没有一个模型能够达到 70%。故障由任务系列和执行面构成,人力资源、管理和多系统业务工作流程是持续的瓶颈,本地工作区修复相对容易但不饱和。仅靠排行榜排名是不够的,因为具有相似通过率的模型在总体完成度上可能存在差异,并且任务级别歧视集中在中间的任务中。 Claw-Eval-Live 建议工作流代理评估应基于新的外部需求和可验证的代理行为两次。