论文

ClawEnvKit:面向类Claw智能体的自动环境生成

ClawEnvKit: Automatic Environment Generation for Claw-Like Agents

模型评测基准与评测资源

摘要

为类Claw(claw-like)智能体构建训练与评测环境仍是一个依赖人力的手动过程,无法规模化。我们主张,所需的不仅仅是一个数据集,而是一条能够按需生成多样化、经过验证的环境的自动化流水线。为此,我们提出ClawEnvKit,一条从自然语言描述出发实例化该形式体系的自主生成流水线。该流水线包含三个模块:(1) 解析器,从自然语言输入中提取结构化生成参数;(2) 生成器,产出任务规范、工具接口和评分配置;(3) 校验器,对生成的环境强制执行可行性、多样性、结构有效性和内部一致性。利用ClawEnvKit,我们构建了Auto-ClawEval——首个面向类Claw智能体的大规模基准,包含24个类别共1,040个环境。实证上,Auto-ClawEval在连贯性与清晰度上达到或超过人工策划的环境,而成本降低13,800倍。在4个模型家族和8个智能体harness框架上的评估中,我们发现harness工程相比裸ReAct基线最多带来15.7个百分点的性能提升,任务完成率仍是主要的变异轴且没有模型饱和该基准,而自动化生成使此前不可行的评测规模成为可能。除静态基准测试外,ClawEnvKit还支持实时评测:用户用自然语言描述期望的能力,即可按需获得一个经过验证的环境,将评测转变为持续的、用户驱动的过程。同一机制还可作为按需训练环境生成器,产出能够适应智能体当前弱点的任务分布,而不受既有用户日志的约束。

ClawEnvKit:面向类Claw智能体的自动环境生成:论文配图
图 1:ClawEnvKit 概览。 ClawEnvKit 提供了三个关键属性(左):与人工策划的基准相当的质量、可扩展到无限数量的环境以及通过按需策划的适应性。该框架支持 4 个以上的模型系列,并与 8 个以上基于爪的代理安全带集成,开箱即用(右)。