论文

RSR递归自改写轨迹

Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite

模型训练合成数据

摘要

困难任务上的成功轨迹为模型改进提供宝贵监督,但专用Harness引入的干预在部署时可能不可用。我们提出递归自改写(RSR):用同一个基座模型Qwen-3.8-27B在多样Harness下发现成功解,并把它们重构为通用Harness下的训练轨迹。规划器把流程提取为运行手册,批评者筛查验证器与解泄漏并指导递归修订,执行器在全新沙箱中按合格运行手册执行。在约3000个自策展终端任务上,三个Harness共同解决759个任务,比记录池中最强单Harness多34.3%。RSR把2001条成功源轨迹扩展为11094条改写轨迹用于监督微调。在其上训练优于基座模型与直接轨迹SFT:与基座相比,Terminal-Bench 2的pass@3从57.0%升至74.2%,Terminal-Bench 4从1.5%升至9.1%,自策展Terminal-Bench Hard从39.0%升至63.0%,Software Terminal-Bench从3.0%升至6.0%;长程Terminal-Bench的过程奖励从0.21升至0.29。结果表明多样Harness辅助的经验可以重构为模型在通用Harness下运行的可复用能力。