论文
OpenClawBench:对真实世界智能体执行轨迹中过程侧异常的基准测试
OpenClawBench: Benchmarking Process-side Anomalies in Real-world Agent Execution Trajectories
摘要
在真实世界的智能体执行中,任务成功可能掩盖过程异常。智能体可能通过了最终任务判定(task oracle),却仍在累积未解决的歧义、不安全的外部写入、被忽视的错误、依据薄弱的承诺或超出能力边界的过度承诺。我们将这种失配称为“结果-过程鸿沟”(Outcome-Process Gap),并引入OpenClawBench——一个用于度量和监督真实智能体执行过程中过程侧异常的大规模数据集。OpenClawBench由6个源模型产生的BFCL驱动OpenClaw会话构建而成,包含31,264条标注轨迹。它将任务判定结果与结构化过程证据对齐。FullTax将对齐后的轨迹转化为结构化异常监督:二分类标签、支持证据、起止位置定位、严重程度、可恢复性以及5类异常分类体系。借助OpenClawBench,我们使结果-过程鸿沟变得可度量。在31,135个通过任务判定的执行中,有2,904个在FullTax下仍被标注为过程异常。这些结果表明,仅以成功为准的评估会遗漏真实智能体执行中一类具体的过程侧失败。在高置信度FullTax监督池上训练的LoRA微调Gemma 3 12B检测器,在标签更干净的留出测试集上达到二分类F1=0.729。总体而言,OpenClawBench将真实的智能体执行日志转化为可审计、可复用的监督数据,用于研究、诊断以及运行时智能体可靠性的运维监测。
