论文
使用采样示范的同策略自蒸馏会降低输出多样性
On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity
摘要
同策略自蒸馏让同一个模型同时充当教师和学生,教师以正确示范为条件提供稠密词元反馈,能获得较强的pass@1表现。本文发现潜在代价:采样轨迹多样性下降,pass@k曲线趋平,增加采样次数不能继续改善准确率。原因在于采样示范带来的偏差会累积:教师以某条采样的正确轨迹为条件评价学生轨迹,反馈经过模型自身偏差传递。理论分析显示,最优自蒸馏策略以学生轨迹和上下文中的正确轨迹之间的逐点条件互信息重新加权原分布。理想同策略RL保持同等正确轨迹的概率比,自蒸馏则可能扩大已有概率差异,使概率进一步集中于优势模式。在受控图寻路和科学问答基准中,自蒸馏模型平均表现可达到或超过RL,但功能与语义多样性显著较低,在要求多样策略的分布外设置中失败。