论文

驾驭退火:学习在较少的外部控制下采取行动

Harness Annealing: Learning to Act with Less External Control

模型训练监督微调与指令调优

摘要

语言Agent依靠外部工具来跟踪状态、组织工作流程并验证答案。除了提供工具和信息之外,这些工具还提供有关调查内容、是否修改以及何时停止的控制决策。对成功的Harness支持的轨迹进行训练可以提高任务性能,同时使这些决策依赖于运行时干预。我们询问Harness支持的经验是否也可以教会模型做出这些决策,从而允许控制划分随着模型的学习而改变。我们称之为目标控制内化:学习承担特定的控制职责,同时在撤回相应的支持后保留任务绩效。我们引入了Harness退火训练(HAT),它将明确的控制监督与在逐渐变弱的Harness下收集的教师轨迹课程相结合。在 SWE-QA 和 SWE-QA-Pro 上使用 9B 和 35B 模型进行的实验评估了四个部署工具下的每个检查点。仅使用工具操作的选定退火检查点所获得的分数接近于使用完整Harness部署的各自起始检查点的分数。好处因模型规模和部署配置而异,并且进一步退火并不能统一提高性能。这些发现表明,Harness支持的体验可以帮助减少训练有素的Agent所需的运行时控制。