论文
RST:递归合成长程终端任务
Recursive Synthesis for Long-Horizon Terminal Tasks
摘要
终端Agent的高质量长时程训练数据制作昂贵,每项任务常需数百至数千美元,因为指令、环境、参考解法和验证器必须相互一致。人工编写难以规模化,直接让LLM生成又常破坏这些依赖。作者提出递归合成终端任务框架RST:从已验证的种子任务出发,扩展参考解法,让验证器和指令适配新工作流,在全新沙箱中验证,再把通过验证的任务用作下一轮种子。十五轮递归生成37,484项终端Agent任务,平均每项约0.05美元。任务难度逐轮上升:参考解法的行数中位数从67增至374,执行命令数中位数从40增至244,DeepSeek-V4-Pro的pass@4从第一轮90%降至第十五轮2.5%。为验证训练价值,作者在合成任务上收集拒绝采样得到的Qwen3.5轨迹,用于监督微调;Qwen3.5-27B和Qwen3.5-122B-A10B在Terminal-Bench 2、Terminal-Bench Hard和Long-Horizon Terminal Bench上最高提升10个百分点。Agentic PPO将Qwen3.5-27B在三个基准上的成绩分别提高至49.44%、32.00%和22.07%,较基础模型相对提升20.0%、41.2%和21.9%。十五轮后,难度继续增长而合成产出率和验证通过率仍稳定,尚未观察到递归上限,表明该流程可能扩展到超过本次报告的规模。
