论文

OpenClawBench:对真实世界智能体执行轨迹中过程侧异常的基准测试

OpenClawBench: Benchmarking Process-side Anomalies in Real-world Agent Execution Trajectories

智能体系统Agent任务评测

摘要

在真实世界的智能体执行中,任务成功可能掩盖过程异常。智能体可能通过了最终任务判定(task oracle),却仍在累积未解决的歧义、不安全的外部写入、被忽视的错误、依据薄弱的承诺或超出能力边界的过度承诺。我们将这种失配称为“结果-过程鸿沟”(Outcome-Process Gap),并引入OpenClawBench——一个用于度量和监督真实智能体执行过程中过程侧异常的大规模数据集。OpenClawBench由6个源模型产生的BFCL驱动OpenClaw会话构建而成,包含31,264条标注轨迹。它将任务判定结果与结构化过程证据对齐。FullTax将对齐后的轨迹转化为结构化异常监督:二分类标签、支持证据、起止位置定位、严重程度、可恢复性以及5类异常分类体系。借助OpenClawBench,我们使结果-过程鸿沟变得可度量。在31,135个通过任务判定的执行中,有2,904个在FullTax下仍被标注为过程异常。这些结果表明,仅以成功为准的评估会遗漏真实智能体执行中一类具体的过程侧失败。在高置信度FullTax监督池上训练的LoRA微调Gemma 3 12B检测器,在标签更干净的留出测试集上达到二分类F1=0.729。总体而言,OpenClawBench将真实的智能体执行日志转化为可审计、可复用的监督数据,用于研究、诊断以及运行时智能体可靠性的运维监测。

OpenClawBench:对真实世界智能体执行轨迹中过程侧异常的基准测试:论文配图
图 1:OpenClawBench 揭示了实际代理执行中的结果与流程差距。 OpenClawBench 将基于 BFCL 的 OpenClaw 会话标准化为 ReAct 风格的轨迹,抽象步骤级流程证据,将跟踪与任务预言结果对齐,并应用 FullTax 来生成异常标签、子类型标签、证据、质量层和本地化目标。右侧面板总结了中心发现:任务成功并不能保证流程可靠性,因为预言机传递执行仍然可能包含流程端异常。预言机结果被用作上下文而不是异常标签,风险切片被用作注释先验而不是地面事实。