论文
ClawEnvKit:面向类Claw智能体的自动环境生成
ClawEnvKit: Automatic Environment Generation for Claw-Like Agents
摘要
为类Claw(claw-like)智能体构建训练与评测环境仍是一个依赖人力的手动过程,无法规模化。我们主张,所需的不仅仅是一个数据集,而是一条能够按需生成多样化、经过验证的环境的自动化流水线。为此,我们提出ClawEnvKit,一条从自然语言描述出发实例化该形式体系的自主生成流水线。该流水线包含三个模块:(1) 解析器,从自然语言输入中提取结构化生成参数;(2) 生成器,产出任务规范、工具接口和评分配置;(3) 校验器,对生成的环境强制执行可行性、多样性、结构有效性和内部一致性。利用ClawEnvKit,我们构建了Auto-ClawEval——首个面向类Claw智能体的大规模基准,包含24个类别共1,040个环境。实证上,Auto-ClawEval在连贯性与清晰度上达到或超过人工策划的环境,而成本降低13,800倍。在4个模型家族和8个智能体harness框架上的评估中,我们发现harness工程相比裸ReAct基线最多带来15.7个百分点的性能提升,任务完成率仍是主要的变异轴且没有模型饱和该基准,而自动化生成使此前不可行的评测规模成为可能。除静态基准测试外,ClawEnvKit还支持实时评测:用户用自然语言描述期望的能力,即可按需获得一个经过验证的环境,将评测转变为持续的、用户驱动的过程。同一机制还可作为按需训练环境生成器,产出能够适应智能体当前弱点的任务分布,而不受既有用户日志的约束。
