论文

CLI-Universe:面向终端智能体的可验证任务合成引擎

CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents

模型训练合成数据

摘要

虽然近期基于LLM的终端智能体展示了有前景的能力——高质量可执行训练数据的稀缺仍是关键瓶颈。既有合成管线通常通过把表面工件改造为任务来扩展——频繁产生含糊指令、浅执行路径与脆弱测试——学习信号弱。为克服这一点——我们介绍CLI-Universe——有原则的终端智能体任务合成引擎。CLI-Universe通过在多维能力分类法(领域、技能类型、能力与工程支柱)上采样组合生成候选任务——然后经对真实技术材料的证据引导深度研究把每个候选锚定。为确保严格监督——经验证的蓝图被实例化到Docker化环境——并经受多阶段可执行验证管线:量规门控测试构造、提示条件过滤与严格的失败转通过检查。跨从候选生成到验证的全管线——约三分之二候选被丢弃——只保留真实、可验证、非平凡挑战的任务。为验证框架——我们实例化高蒸馏的6,000轨迹数据集CLI-Universe-6K。值得注意的是——在CLI-Universe-6K上微调Qwen3-32B在Terminal-Bench 2.0达到33.4%——为不超32B参数的开源数据训练模型创下新SOTA——并超越多个大一个数量级的模型——展示结构化、高保真合成的深刻数据效率。

CLI-Universe:面向终端智能体的可验证任务合成引擎:论文配图
图 1:CLI-Universe 概述。第 1 步(查询构建):结构化分类法为不同的候选任务提供种子;每一项都经过反复深入的研究并编译成蓝图。步骤 2(环境综合):将蓝图实现为具有物化资产和经过验证的运行时的 Docker 容器。步骤3(验证和过滤):测试代理和解决方案代理独立验证任务;仅保留通过标题门控测试和未能通过检查的实例。