Harness-Zero:以 Agent-as-Harness 实现 Harness 蒸馏
Harness-Zero: Harness Distillation via Agent-as-Harness
摘要
Agent Harness(智能体脚手架)是调节模型与环境交互的外部系统,能显著提升 Agent 性能,但其收益在部署时仍依附于该 Harness。由于最优 Harness 随领域、实例和模型而异,通用 Agent 要么将就于次优的共享 Harness,要么在日益增多的专用 Harness 之间路由。因此,我们研究 Agent Harness 蒸馏:以领域或实例优化的 Harness 作为训练期引导,把其诱导的行为迁移进模型权重,使其收益在单一的固定目标 Harness 下依然保留。挑战在于两种 Harness 的动作空间和可用信息不同,优化 Harness 的引导无法直接充当目标 Harness 的监督。我们提出 Harness-Zero,通过 agent-as-harness 实现 Harness 蒸馏:在优化 Harness 的引导下,一个 harnessing Agent 在目标 Harness 的动作空间中、于执行前纠正学生模型的响应,从而把 Harness 引导转化为训练示范。在所得轨迹上微调可将 Harness 诱导的行为内化进模型,使专用 Harness 在部署时可以被移除。横跨知识工作、工具使用与科学领域的实验表明:(1) 对使用同一进化 Harness 的前沿 LLM,agent-as-harness 优于 code-as-harness;(2) 部署时移除专用 Harness 后,Harness-Zero 将基础模型的宏平均任务成功率从 23.3% 提升到 44.3%,甚至超过仍挂载该 Harness 时的 41.7%;(3) Harness-Zero 能恢复基础模型缺失的 Harness 诱导行为,在三个领域的 28 种模式上平均恢复率达 82.3%。
