论文

RST:递归合成长程终端任务

Recursive Synthesis for Long-Horizon Terminal Tasks

模型训练AI 基础设施合成数据SandboxAgent Sandbox

摘要

终端Agent的高质量长时程训练数据制作昂贵,每项任务常需数百至数千美元,因为指令、环境、参考解法和验证器必须相互一致。人工编写难以规模化,直接让LLM生成又常破坏这些依赖。作者提出递归合成终端任务框架RST:从已验证的种子任务出发,扩展参考解法,让验证器和指令适配新工作流,在全新沙箱中验证,再把通过验证的任务用作下一轮种子。十五轮递归生成37,484项终端Agent任务,平均每项约0.05美元。任务难度逐轮上升:参考解法的行数中位数从67增至374,执行命令数中位数从40增至244,DeepSeek-V4-Pro的pass@4从第一轮90%降至第十五轮2.5%。为验证训练价值,作者在合成任务上收集拒绝采样得到的Qwen3.5轨迹,用于监督微调;Qwen3.5-27B和Qwen3.5-122B-A10B在Terminal-Bench 2、Terminal-Bench Hard和Long-Horizon Terminal Bench上最高提升10个百分点。Agentic PPO将Qwen3.5-27B在三个基准上的成绩分别提高至49.44%、32.00%和22.07%,较基础模型相对提升20.0%、41.2%和21.9%。十五轮后,难度继续增长而合成产出率和验证通过率仍稳定,尚未观察到递归上限,表明该流程可能扩展到超过本次报告的规模。

RST:递归合成长程终端任务:论文配图
图 4:通过递归合成 639 个引导种子的域组成和稳定性。 (a) R1R_{1}、R5R_{5}、R10R_{10} 和 R15R_{15} 处种子池和预言机传递任务的祖先域比例。 (b) 通过归一化香农熵测量的分布均匀度。 (c) 域宽度通过域的代表性数量和有效数量来衡量。 (d) 领域集中度,通过属于 Top-1 和 Top-3 领域的任务比例来衡量。稳定的熵和有效域计数表明,通过 R15R_{15} 保留了域多样性,没有广泛的域崩溃。