论文

面向OpenClaw与Codex的轨迹安全评估与诊断基准:ATBench-Claw与ATBench-Codex

Benchmarks for Trajectory Safety Evaluation and Diagnosis in OpenClaw and Codex: ATBench-Claw and ATBench-CodeX

智能体系统Agent任务评测

摘要

随着智能体系统进入日益多样的执行环境,轨迹级安全评估与诊断需要能与之同步演进的基准。ATBench是一个多样化且贴近真实的智能体轨迹安全评估与诊断基准。本报告介绍ATBench-Claw与ATBench-Codex两个领域定制化扩展,将ATBench引入OpenClaw以及OpenAI Codex / Codex运行时环境。其关键适配机制是:先分析每个新环境,围绕风险来源、失效模式与现实危害三个维度定制三维安全分类体系(Safety Taxonomy),再用定制后的分类体系定义基准规范,供共享的ATBench构建流水线使用。这种可扩展性之所以重要,是因为智能体框架在架构层面保持相对稳定,而其具体执行环境、工具生态与产品能力却在快速演进。具体而言,ATBench-Claw针对OpenClaw中涉及工具、技能、会话与外部动作的敏感执行链,而ATBench-Codex针对OpenAI Codex / Codex运行时环境中涉及仓库、shell、补丁、依赖、审批与运行时策略边界的轨迹。因此,我们的重点在于分类体系定制、领域特定风险覆盖,以及在共享ATBench生成框架下的基准设计。