论文

HAD:小模型智能体的Harness感知蒸馏

Harness-Aware Distillation for Small Language Model Agents

模型优化上下文与知识上下文工程蒸馏

摘要

语言模型智能体随Harness部署——Harness是管理上下文、工具与反馈的模型外围软件。把这类智能体蒸馏为更小的模型时,Harness保持不变,因此学生主要需要教师特有的、Harness无法提供的能力,例如正确依从Harness信息行动。标准蒸馏却模仿教师的完整输出并把Harness当作输入的一部分。我们提出Harness感知蒸馏(HAD),把蒸馏聚焦于教师在Harness之外增加的部分。HAD以两组件补充在线蒸馏:动作偏好——对比同一教师在有无Harness信息时的动作,在学生自身推理之后打分;有效性检查——丢弃偏好动作与Harness记录相矛盾的偏好对。我们证明这种对比给学生提供单靠模仿教师无法提供的信息,且HAD不需要任务奖励、成功标签或未来信息。跨多个长程智能体基准与模型,HAD在相同固定Harness下优于在线蒸馏基线。分析显示HAD更少进入无产出循环、更常从错误恢复,并提示其自适应地把可学习反馈保留在权重中、从Harness读取状态信息。