论文

TermiGen:面向终端智能体的高保真环境与鲁棒轨迹合成

TermiGen: High-Fidelity Environment and Robust Trajectory Synthesis for Terminal Agents

模型训练合成数据

摘要

对开放权重的大语言模型(LLM)而言,执行复杂终端任务仍是一项重大挑战,其受制于两个根本性局限。其一,高保真、可执行的训练环境稀缺:从真实世界仓库合成的环境不具备多样性和可扩展性,而由LLM合成的轨迹则存在幻觉问题。其二,标准指令微调所用的专家轨迹很少呈现较小模型常见的简单错误。这造成了分布失配,使学生模型难以从自身的运行时失败中恢复。为弥合这些缺口,我们提出TermiGen,一个用于合成可验证环境与鲁棒专家轨迹的端到端流水线。TermiGen首先通过迭代式多智能体精炼循环生成功能有效的任务与Docker容器。随后,我们采用生成器-评估器(Generator-Critic)协议,在轨迹采集过程中主动注入错误,合成富含纠错循环的数据。在该TermiGen生成数据集上微调后,我们的TermiGen-Qwen2.5-Coder-32B在TerminalBench上取得31.3%的通过率。这确立了新的开放权重最优水平,超越了现有基线,并显著超过o4-mini等强大的专有模型。数据集可在 https://github.com/ucsb-mlsec/terminal-bench-env 获取。

TermiGen:面向终端智能体的高保真环境与鲁棒轨迹合成
图2:TermiGen 的总体流程。阶段 I 在 Docker 容器内通过迭代细化生成多样化且功能有效的任务(第 3.2 节)。阶段 II 通过向执行流程中主动注入错误来合成鲁棒的专家轨迹,使模型能够学习错误诊断与恢复(第 3.3 节)。