论文

ClawForge:为命令行智能体生成可执行的交互式基准

ClawForge: Generating Executable Interactive Benchmarks for Command-Line Agents

智能体系统Agent任务评测

摘要

交互式智能体基准面临可扩展构建与真实工作流评估之间的张力。手工编写的任务扩展和修订成本高,而静态提示评估会遗漏只有在智能体操作持久状态时才暴露的失败。现有交互式基准已显著推进智能体评估,但大多从干净状态初始化任务,并未系统性地测试智能体如何处理预先存在的部分完成、过时或冲突的制品。我们提出ClawForge,一个面向状态冲突下可执行命令行工作流的、由生成器支撑的基准框架。该框架将场景模板、落地槽位、初始化状态、参考轨迹与验证器编译为可复现的任务规格,并基于归一化的终态与可观察副作用(而非精确轨迹匹配)逐步评估智能体在持久工作流表面上的表现。我们将该框架实例化为ClawForge-Bench(17个场景、6个能力类别)。跨七个前沿模型的结果显示,最佳模型的严格准确率仅45.3%,所有模型的错误状态替换率仍低于17%,而最大的模型差距(17%到90%)取决于智能体在行动前是否检查现有状态。部分得分与步数效率分析进一步揭示,许多失败是接近成功的收尾失误而非早期崩溃,且模型在状态冲突下表现出质性不同的失败风格。

ClawForge:为命令行智能体生成可执行的交互式基准:论文配图
图1:ClawForge-Bench覆盖面:内环为6个一级能力类,外环为各类下17个场景族。