论文
诊断推理语言模型的同on-policy自蒸馏
Diagnosing On-Policy Self-Distillation for Reasoning Language Models
摘要
在on-policy自蒸馏(OPSD)作为一种提高语言模型推理能力的有前途的方法引起了越来越多的兴趣。没有外部奖励,也没有单独的更强大的老师,拥有特权信息的自学者可以提供有关学生轨迹的密集信号。然而,它在语言推理中的行为仍不清楚,报告的结果从适度的进步到行为崩溃不等。在这项工作中,我们诊断 OPSD,以跨跨 0.6B--8B 参数的模型进行数学推理。我们进行对照实验和词元级分析,以全面深入研究 OPSD。我们指出,教师信号是由推理模式对齐和完整的教师前缀决定的,而不仅仅是特权语义。 OPSD 仅在狭窄的兼容性机制中改进推理。否则,它会产生无效的长度增长、稳定的降解或行为崩溃。词元层面的分析表明,老师的信号不稳定,并不能预测下游的表现。基于这些结果,我们认为 OPSD 是一种敏感算法,而不是一种普遍可靠的训练后推理改进方法。