论文

什么真正提升数学推理:纯代码之外的结构化推理信号

What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code

模型评测模型行为与机制分析

摘要

代码已成为现代基础语言模型(LM)训练的标准组成部分,但其在编程之外的作用仍不清楚。我们通过在具有细粒度领域划分的10T token语料上进行受控预训练实验,重新审视代码能提升推理这一论断。我们的发现有三点。首先,当代码仅限于独立可执行程序并对Code-NL数据加以控制后,代码能大幅提升编程能力,但并非通用的推理增强剂;相反,它会与知识密集型任务竞争,尤其是复杂数学推理。其次,常被归于代码的推理收益,用跨领域结构化推理痕迹(如代码-文本与数学-文本混合数据)来解释更为恰当,而非可执行代码本身。第三,在固定数学数据预算内提高结构化数学领域样本的密度,可在困难数学推理上带来可观收益,同时大体保持编程性能,表明认知脚手架为缓解跨域权衡提供了有针对性的途径。最后,路由分析显示数据配比效应体现在专家激活模式中,为跨领域竞争与协同作用提供了机制层面的证据。我们的结果澄清了哪些数据特性能跨能力维度迁移,并指向更精准的以数据为中心的优化策略。

什么真正提升数学推理:纯代码之外的结构化推理信号:论文配图
图 5:不同数据配置下数学、代码和 QA 领域的 MoE 专家路由概率偏差和 JS 分歧。上排显示了每个领域内相对于全数据模型绝对偏差最大的 20 位专家;下面一行报告了完整的专家路由分布之间的成对 JS 分歧。