论文
超越压缩:诊断训练后如何改变数学推理
Beyond Compression: Diagnosing How Post-Training Changes Mathematical Reasoning
摘要
后训练是现代大语言模型 (LLM) 中数学推理的核心,但仅端点 pass@1 无法识别发生了什么变化。收益可能反映新可达的解决方案、潜在解决方案的更便宜的采样、表面鲁棒性或记忆。我们在通用诊断读数下比较了三个训练后路径:经过充分训练的off-policy蒸馏轨迹、发布的 Qwen3 off-policy加on-policy蒸馏端点以及使用组相对策略优化 (GRPO) 训练的发布的 DeepSeek-Math 端点。我们的探针使用跨表面 pass@K 逐字提示、释义、数值同构和翻译,以及一致性、分布形状和经过验证的监督微调 (SFT) 隶属度分析。我们发现两种制度。在更简单的AMC问题上,大K上限接近饱和,因此后训练主要压缩样本成本。在较难的 AIME 问题上,训练后扩大了基础模型的大 K 上限:足够的off-policy蒸馏已经提高了这个上限,Qwen3 发布的端点进一步提高了它,而 DeepSeek-Math GRPO 并没有在大 K 上主导足够的off-policy蒸馏。以英语为主的蒸馏改进了非英语推理,但保留了语言层差距。受控过度拟合审计发现当前 SFT 成员资格探测的敏感性有限。压缩是训练后的一种方式,而不是普遍的解释。