论文
质量-效用悖论:为何高奖励数据损害小模型数学推理
The Quality-Utility Paradox: Why High-Reward Data Impairs Small Model Mathematical Reasoning
摘要
从强推理模型蒸馏知识被广泛用于改进小语言模型(SLM)的数学推理——常假设奖励模型分数更高的踪迹提供更有用的监督。我们在数学推理蒸馏中识别出一个反直觉的质量-效用悖论。经更强神谕精化或合成的数据按奖励模型衡量感知质量更高——却持续逊于SLM自己生成、经拒绝采样选择的踪迹——跨Qwen2.5、LLaMA-3与DeepSeek家族皆然。我们的分析显示:神谕精化把逻辑修复与偏离SLM原生推理分布的分布漂移耦合。该漂移增加学习者的适配成本——并可能超过改进推理逻辑的收益。为检验该机制——我们引入风格对齐精化——保留SLM原生轨迹同时保留来自神谕的逻辑修复。该干预降低适配成本并恢复下游效用。这些发现表明:有效的数学推理蒸馏应联合优化感知解质量与学习者-数据兼容性——而非仅依赖奖励模型分数。数据与代码见 https://github.com/Dracoqhl/Quality-Utility-Paradox。
