论文

什么使交互轨迹对训练终端智能体有效?

What Makes Interaction Trajectories Effective for Training Terminal Agents?

模型训练智能体系统监督微调与指令调优Agent Harness

摘要

更强的代码代理通常被认为是后训练的优秀教师,但这种假设仍然很难与任务难度、工具设计和学生能力分开。我们使用 Terminal-Lego 来研究这种教学联系,这是一个可扩展的管道,可将多领域的现实世界问题转换为经过环境验证的代理任务。令人惊讶的是,独立表现并不决定教学效果:虽然 Claude Opus 4.6 在 Terminal-Bench 2.0 上取得了更高的分数,但学生根据得分较低的代理 DeepSeek-V3.2 的轨迹进行微调,表现出明显更强的泛化能力。我们将这种“教学悖论”归因于基于环境的监督(EGS):通过可见的交互显式暴露检查-行动-验证行为的轨迹使学生能够内化强大的解决问题的例程,而不是脆弱的行动序列。扩展分析揭示了卓越的数据效率:例如,Qwen3-32B 仅使用 15.3k 个 Terminal-Lego 轨迹,就在 Terminal-Bench 2.0 上取得了 24.3% 的分数,可与之前以超过 30 倍数据量建立的 SOTA 性能相媲美。我们的结果表明,智能体训练后的前沿不仅仅在于结果匹配,而是将重点转向“利用工程”,其中基于环境的交互结构的系统设计是可重复和可推广的智能体的主要催化剂。

什么使交互轨迹对训练终端智能体有效?:论文配图
图 2:Terminal-Lego 施工流程。 StackOverflow问题被过滤到现实来源,通过级联任务构建进行转换,并在Docker往返验证后保留。