论文

选择长时域轨迹以训练可靠高效的终端智能体

Selecting Long-Horizon Trajectories for Reliable and Efficient Terminal-Agent Training

模型训练监督微调与指令调优

摘要

终端智能体通常通过模仿长 教师模型 轨迹进行训练,但每个轨迹的监督量仍有待探索。我们研究了 监督视野,即为训练保留的轨迹 token 的数量,并表明它是可靠性和成本的关键设计轴。可靠性随着时间范围的延长而提高,但会饱和:在 Terminal-Bench 上,12K-token 时间范围可以解决比 16K 更多的任务($29\pm0.7$ 与 $26\pm0.8$),同时需要的训练时间减少 30%。视野也会影响智能体的行为:较短的视野会导致过早终止,中间的视野会产生有效的错误恢复,而较长的视野会导致过度持久。我们通过偏差复杂性界限来分析这种饱和度,其中较长的监督减少了时间监督偏差,但增加了来自更多异质后期历史的有限样本估计误差。在此分析的指导下,我们提出选择性长范围细化,它首先在短前缀上进行训练,然后仅对最有可能在热启动模型下的延续进行细化。它的性能始终优于全长视训练。在 16K 时,它提高了从 $110\pm2.7$ 到 $126\pm2.1$ 的成功尝试,并在从 $9\pm0.7$ 到 $14\pm0.6$ 的八次尝试中至少有六次解决了任务;使用一半的长视野数据,仍然达到 $122\pm2.4$,同时将训练时间缩短 23%。收益跨基准转移,从 Terminal-Bench v2.0 上的 $64\pm2.6$ 到 $73\pm2.1$,以及 OpenThoughts-TBLite 上从 $137\pm2.7$ 到 $155\pm2.2$。对于长期监督,选择正确的轨迹比所有轨迹上的训练更重要。