论文
指令而非答案:on-policy上下文蒸馏中的指令特权
Instruct, Not Answer: Using Instruction Privileges in On-Policy Context Distillation
摘要
on-policy上下文蒸馏(OPCD)最近成为一种强大的技术,可以将上下文转移到学生模型并进行自我改进。在 OPCD 中,教师以特权信息为条件,目标是最小化特权教师和学生之间的 Kullback-Leibler (KL) 差异,并根据学生生成的词元进行评估。许多现有研究表明,使用特定于实例的黄金答案或黄金演示作为默认权限可能会损害训练性能,尤其是分布外(OOD)。在这项工作中,我们设计了针对在训练样本上观察到的常见学生错误的通用指令,并表明这种简单的指令可以优于黄金作为 OPCD 特权。在自动形式化任务中,使用匹配的格式化指令作为特权可以在 OOD 准确性方面大幅超越黄金。在使用 ProverQA、ProofWriter 和 ProntoQA 作为数据集、Qwen3-Thinking 和 Olmo3-Thinking 系列作为模型的 8 项实验中,有 7 项实验的结果表明,匹配指令特权在 OOD 中的表现比黄金高出 4 到 17 个点,同时与领域内的黄金保持同等水平。每条指令只有几个句子(因此与所有特定于实例的黄金相比,包含的信息要少得多),并且统一应用于每个训练样本。这些结果表明,同样适用于源域示例和目标域示例的通用指令比 OPCD 中的实例特定黄金具有更高的可转移性,同时保持域内性能。
