论文

当 Top-K 错过决策时:多教师中的工具调用漂移 同策略 蒸馏

When Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy Distillation

摘要

Top-$K$ 教师 logits 使 同策略 蒸馏 易于处理,但保留的教师质量并不能证明学生相对梯度保真度。我们研究路由式、两位教师工具使用 蒸馏。在冻结的 Qwen3.5-9B 审核中,工具老师将入口标记在 500 个工具提示中排名第一,而 top-32 在每对匹配的工具提示中都强化了它。相反,响应教师的 top-32 保留了 99.99\% 的质量,但在 500 个响应提示中仅 0.4\% 包含相同的标记;学生意识支持恢复了所有匹配对的坐标,并且几乎匹配完整词汇的下降。在工具路线上,尽管质量显示为 1.000000,top-32 保留了增强方向,但大大削弱了其完整词汇量。匹配恢复将响应侧遗漏与行为联系起来:恢复每个受监督响应位置的入口坐标可以将三个种子的全代超调用从 $14.2 \pm 2.1\%$ 降低到 $3.7 \pm 0.5\%$,但也将调用召回率降低了 12.4 个点。非工具安慰剂仅使过度呼叫改变 0.95 点。合成输出 logits 梯度匹配的重新路由也无法重现精确的恢复。我们比较了三个优化层:学生感知的支持改变了蒸馏坐标,损失整形改变了保留信号强度,以及验证调整的进入偏差在无需重新训练的情况下改变了推理。它们在纠正范围、系统访问和所需呼叫保留方面暴露出明显的权衡。 Llama-3.1-8B 在其原生 JSON 协议下再现了方向支持不对称性。结果因果关系表明决策关键支持遗漏是主要 Qwen 设置中的一个贡献者,并说明了为什么必须审核支持保真度和部署成本。代码和聚合工件可在 https://github.com/shen-jiabin/decision-support-opd 获取。