论文
CLI-Universe:面向终端智能体的可验证任务合成引擎
CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents
摘要
虽然近期基于LLM的终端智能体展示了有前景的能力——高质量可执行训练数据的稀缺仍是关键瓶颈。既有合成管线通常通过把表面工件改造为任务来扩展——频繁产生含糊指令、浅执行路径与脆弱测试——学习信号弱。为克服这一点——我们介绍CLI-Universe——有原则的终端智能体任务合成引擎。CLI-Universe通过在多维能力分类法(领域、技能类型、能力与工程支柱)上采样组合生成候选任务——然后经对真实技术材料的证据引导深度研究把每个候选锚定。为确保严格监督——经验证的蓝图被实例化到Docker化环境——并经受多阶段可执行验证管线:量规门控测试构造、提示条件过滤与严格的失败转通过检查。跨从候选生成到验证的全管线——约三分之二候选被丢弃——只保留真实、可验证、非平凡挑战的任务。为验证框架——我们实例化高蒸馏的6,000轨迹数据集CLI-Universe-6K。值得注意的是——在CLI-Universe-6K上微调Qwen3-32B在Terminal-Bench 2.0达到33.4%——为不超32B参数的开源数据训练模型创下新SOTA——并超越多个大一个数量级的模型——展示结构化、高保真合成的深刻数据效率。
