论文

质量-效用悖论:为何高奖励数据损害小模型数学推理

The Quality-Utility Paradox: Why High-Reward Data Impairs Small Model Mathematical Reasoning

摘要

从强推理模型蒸馏知识被广泛用于改进小语言模型(SLM)的数学推理——常假设奖励模型分数更高的踪迹提供更有用的监督。我们在数学推理蒸馏中识别出一个反直觉的质量-效用悖论。经更强神谕精化或合成的数据按奖励模型衡量感知质量更高——却持续逊于SLM自己生成、经拒绝采样选择的踪迹——跨Qwen2.5、LLaMA-3与DeepSeek家族皆然。我们的分析显示:神谕精化把逻辑修复与偏离SLM原生推理分布的分布漂移耦合。该漂移增加学习者的适配成本——并可能超过改进推理逻辑的收益。为检验该机制——我们引入风格对齐精化——保留SLM原生轨迹同时保留来自神谕的逻辑修复。该干预降低适配成本并恢复下游效用。这些发现表明:有效的数学推理蒸馏应联合优化感知解质量与学习者-数据兼容性——而非仅依赖奖励模型分数。数据与代码见 https://github.com/Dracoqhl/Quality-Utility-Paradox。

质量-效用悖论:为何高奖励数据损害小模型数学推理:论文配图
图 1:质量-效用悖论。我们可视化训练数据的感知质量与其实际下游效用之间的关系。尽管 SLM-RFT 数据的奖励分数最低,但 1.5B 和 7B 模型的性能最高。相反,由预言机提炼或生成的数据可以获得较高的奖励分数,但会导致下游性能不佳。