论文
PAINT:自蒸馏推理机的部分解决方案自适应插值训练
PAINT: Partial-Solution Adaptive Interpolated Training for Self-Distilled Reasoners
摘要
改进 大语言模型 (LLM) 推理需要监督,该监督既与模型自身的测试时间状态保持一致,又在 词元级 中提供信息。具有可验证奖励的强化学习提供了 同策略 探索,但提供了稀疏、高方差的信用;受监督的 微调 和 蒸馏 提供密集的目标,但通常在固定轨迹上进行训练或依赖更强的教师。最近享有特权的 同策略 自 蒸馏 通过在经过验证的解决方案环境下使用相同模型对学生采样轨迹进行评分,探索了中间立场。我们通过情境重新评分镜头重新审视这一设置:为了推理,重要的选择不仅是特权情境是否可用,还包括应透露多少内容以及其分布应在何处塑造学生。我们提出 PAINT(部分解决方案自适应插值训练),它根据采样轨迹参考重叠屏蔽经过验证的解决方案,并对一组稀疏的熵不匹配标记位置应用小能量空间插值。在竞赛级别的数学基准中,PAINT 在所有三个 Qwen3 量表上始终优于先前的 同策略 自 蒸馏 基线。在 Qwen3-8B 上,它使宏 Avg@12 比之前的基线提高了 2.1 个点,比 GRPO 提高了 2.9 个点。