论文

Harness-Zero:以 Agent-as-Harness 实现 Harness 蒸馏

Harness-Zero: Harness Distillation via Agent-as-Harness

模型优化智能体系统Agent Harness蒸馏

摘要

Agent Harness(智能体脚手架)是调节模型与环境交互的外部系统,能显著提升 Agent 性能,但其收益在部署时仍依附于该 Harness。由于最优 Harness 随领域、实例和模型而异,通用 Agent 要么将就于次优的共享 Harness,要么在日益增多的专用 Harness 之间路由。因此,我们研究 Agent Harness 蒸馏:以领域或实例优化的 Harness 作为训练期引导,把其诱导的行为迁移进模型权重,使其收益在单一的固定目标 Harness 下依然保留。挑战在于两种 Harness 的动作空间和可用信息不同,优化 Harness 的引导无法直接充当目标 Harness 的监督。我们提出 Harness-Zero,通过 agent-as-harness 实现 Harness 蒸馏:在优化 Harness 的引导下,一个 harnessing Agent 在目标 Harness 的动作空间中、于执行前纠正学生模型的响应,从而把 Harness 引导转化为训练示范。在所得轨迹上微调可将 Harness 诱导的行为内化进模型,使专用 Harness 在部署时可以被移除。横跨知识工作、工具使用与科学领域的实验表明:(1) 对使用同一进化 Harness 的前沿 LLM,agent-as-harness 优于 code-as-harness;(2) 部署时移除专用 Harness 后,Harness-Zero 将基础模型的宏平均任务成功率从 23.3% 提升到 44.3%,甚至超过仍挂载该 Harness 时的 41.7%;(3) Harness-Zero 能恢复基础模型缺失的 Harness 诱导行为,在三个领域的 28 种模式上平均恢复率达 82.3%。

Harness-Zero:以 Agent-as-Harness 实现 Harness 蒸馏:论文配图
图 1:Harness-Zero 概览。(1) 进化与适配。我们在训练任务上进化一个学生侧 harness h⋆,并将其适配为相对固定目标 harness h 的私有参考 harness 𝒦。(2) 以智能体为 harness 的轨迹收集。学生 π_S 在 h 下运行并在每一轮提出回复 y_t。harness 智能体 π_H 使用 𝒦 对其评审,并在需要时予以纠正(ỹ_t)。ỹ_t 经由 h 执行并进入学生的上下文,而评审过程保持私有。(3) 训练与部署。我们对经评审的轨迹 𝒟_review 应用 SFT,并在损失中屏蔽任何无意中混入的评审者视角推理。蒸馏后的学生仅在 h 下部署,不依赖 h⋆、𝒦 或 π_H。