论文

PIVOT:用于垂直域少样本蒸馏的基于困惑的 KD 到 RL 转换调度

PIVOT: Perplexity-Informed KD-to-RL Transition Scheduling for Vertical-Domain Few-Shot Distillation

模型优化模型训练强化学习蒸馏

摘要

垂直领域的小样本分类对于小型语言模型来说仍然具有挑战性,因为有限的监督使得获取特定领域的决策知识变得困难。按策略蒸馏 (OPD) 可以通过监督学生生成的部署来改进教师引导的适应,而基于 GRPO 的强化学习可以进一步细化下游预测。然而,现有的 KD 到 RL 流程通常依赖于全局固定的转换时间表,忽略了不同的样本在奖励驱动的细化之前可能需要不同数量的教师指导的采集。我们提出了 PIVOT(Perplexity-Informed Transition Optimization),这是一种动态转换框架,可根据教师评估的序列困惑度在 OPD 和 GRPO 之间路由样本。 PIVOT 将低困惑度样本移至 GRPO 进行奖励驱动的细化,同时将高困惑度样本保留在 OPD 下以持续获取领域知识。 Banking77 和 HWU64 上的实验表明,在相同条件下,PIVOT 始终优于持续 OPD 和全球同步的 OPD$\rightarrow$GRPO 基线。 热身后学生优化步骤数,实现更强的下游性能和更稳定的训练动态。