论文

Meta-Task:把终端任务合成变成终端任务以实现可扩展的智能体训练

Meta-Task: Turning Terminal Task Synthesis into a Terminal Task for Scalable Agent Training

模型训练合成数据

摘要

大规模训练终端(terminal)智能体需要多样、可验证的终端任务和高质量交互轨迹,然而获取这类数据仍是重大挑战。现有合成方法存在两个关键局限:(1) 任务生成与真实执行脱节导致可靠性弱;(2) 依赖现有仓库导致多样性与可扩展性受限。我们提出Meta-Task,一个把终端任务合成本身重新定义为一项Terminal-Bench格式任务的框架:智能体在真实容器环境中迭代地生成、执行并验证任务,使合成组件在生成回路内部即被检验内部一致性与可执行性。在此基础上,我们沿多个维度解耦目标任务需求,引入一个多阶段机制,在实际产出任务之前动态设计新的任务规范,并引入可选的外部素材支持以增强多样性与真实感。我们还应用LLM-as-Judge过滤以保证最终训练数据的质量。在Terminal-Bench 2.0上的实验表明,仅在3,221条Meta-Task合成轨迹上微调,Qwen3-14B和Qwen3-32B分别达到22.5%和31.8%的Avg Pass@1,以显著更少的训练数据超越了同期方法。

Meta-Task:把终端任务合成变成终端任务以实现可扩展的智能体训练:论文配图
图 1:左:Terminal-Bench 任务包的文件结构。右图:评估工作流程,包括环境构建、代理执行和自动验证。