论文
一名学生,多名教师:通过软提示特权上下文执行多任务 同策略 蒸馏
One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context
摘要
同策略 自我 蒸馏 (OPSD) 通过与学生共享骨干并监督其自身推广的老师教授 大语言模型 新技能。现有的教师要么在输入中注入特权上下文——引发事后合理化——要么微调权重,累积任务中的偏差和遗忘。我们提出 \ 方法,其老师与学生的区别仅在于可学习的软提示:在主干冻结的 $(x, y_\text{gold})$ 对上进行训练,提示产生一个特定于任务的老师,保留学生的精确表征几何。 \method\ 通过将合并语料库中的每个示例路由到其相应的软提示教师,自然地扩展到多任务设置,从而允许单个学生并行吸收 $K$ 教师的知识;在推理时,所有提示都被丢弃。在 Qwen3-1.7B-Base 和 Phi-4-mini-instruct 的四项任务(科学、工具使用、生物学、数学)上,单任务变体(PT 教师的 OPD)匹配或超过完整的 微调,同时训练数量级更少的参数,多任务变体实现了最佳总体平均值(Qwen3-1.7B-Base 为 56.2分),同时保留了一般能力基准 - 与顺序 SFT,这会降低两者的性能。