论文

用于领域后训练的自专门化教师模型

Self-Specialized Teachers for Domain Post-Training

摘要

仅目标训练后可以提高专门领域的性能,同时降低通用基础模型在适应之前获得的行为。当目标域数据可用但代表性重播语料库不可用时,我们研究这个问题。我们提出了自我专业化教师蒸馏(SSTD),这是一个两阶段的过程,首先将基本模型的副本训练为领域教师,然后根据从学生本身采样的前缀将其令牌分布蒸馏给学生。教师训练将标准目标监督与基础感知关键令牌加权和分布对齐结合到冻结的基础模型;然后,在策略蒸馏将域反馈放在学生在推理时可能遇到的状态上。在财务数值推理、医学问答和合法持有识别方面,SSTD 保留了直接微调的大部分目标改进,同时在报告的操作点上将评估的一般套件的平均分数提高了 4.8--5.0 分。这种图案在 Qwen3 尺寸和 Gemma 骨干上都存在。 SSTD 既不需要外部教师,也不需要一般重播数据。

用于领域后训练的自专门化教师模型:论文配图
图1 有限重播集直接制约了基础模型一般行为的一小部分。在目标域培训后适应期间,这一覆盖范围以外的一般行为没有直接保留信号,而且即使模型获得理想的域内专门知识,也可能漂移。