论文
TermiGen:面向终端智能体的高保真环境与鲁棒轨迹合成
TermiGen: High-Fidelity Environment and Robust Trajectory Synthesis for Terminal Agents
摘要
对开放权重的大语言模型(LLM)而言,执行复杂终端任务仍是一项重大挑战,其受制于两个根本性局限。其一,高保真、可执行的训练环境稀缺:从真实世界仓库合成的环境不具备多样性和可扩展性,而由LLM合成的轨迹则存在幻觉问题。其二,标准指令微调所用的专家轨迹很少呈现较小模型常见的简单错误。这造成了分布失配,使学生模型难以从自身的运行时失败中恢复。为弥合这些缺口,我们提出TermiGen,一个用于合成可验证环境与鲁棒专家轨迹的端到端流水线。TermiGen首先通过迭代式多智能体精炼循环生成功能有效的任务与Docker容器。随后,我们采用生成器-评估器(Generator-Critic)协议,在轨迹采集过程中主动注入错误,合成富含纠错循环的数据。在该TermiGen生成数据集上微调后,我们的TermiGen-Qwen2.5-Coder-32B在TerminalBench上取得31.3%的通过率。这确立了新的开放权重最优水平,超越了现有基线,并显著超过o4-mini等强大的专有模型。数据集可在 https://github.com/ucsb-mlsec/terminal-bench-env 获取。
