论文
ClawProBench:具备运行时覆盖与冻结职场式保留集的AI智能体轨迹感知评测
ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts
摘要
智能体基准通常只评估最终答案,即使智能体运行在有状态的运行时上。我们认为这使得被评估的对象欠明确:合适的评估单元是一个声明的模型加运行时配置,其失败可能发生在证据获取、运行时路由、安全边界或重复执行等环节。我们提出ClawProBench,一个面向运行时原生的智能体评估的轨迹感知基准,实例化于OpenClaw——一个带工作区工具以及浏览、记忆、消息、日程、技能与子智能体等原生界面的实时智能体运行时。ClawProBench定义两条赛道:一个102场景的全配置(full profile),含实时工作区与原生运行时路由任务;以及一个冻结的68场景保留集(holdout),采用封闭世界JSON输出契约,用于稳健排名。试验从执行轨迹出发,经一个安全门控公式打分,结合正确性、过程质量与效率,保留失败证据以供审计。我们的匿名工件包含基准定义、评分代码、清单与脱敏轨迹。我们在全配置上评估68个配置,在保留集上评估37个。安全门控平均轨迹分最高为0.7671。原生运行时任务表现不及工作区实时任务(0.5238对0.6415)。在保留集上,pass@k-any优于严格三次试验通过(0.6638对0.2890),而全配置与保留集排名的对齐很弱(Spearman 0.1300)。纯粹基于正确性的排名与过程感知、安全门控及严格通过等视角差异显著。仅看最终答案的排行榜可能掩盖原生界面弱点、一次性成功与轨迹局部的智能体失败模式。
