论文

后训练将解决什么问题?每个问题的增益在独立的 RL 运行中共享,现有的检查点比先验信号更好地预测它们

What Will Post-Training Fix? Per-Problem Gains Are Shared Across Independent RL Runs, and Existing Checkpoints Predict Them Better Than A Priori Signals

模型评测模型行为与机制分析

摘要

后训练配方的数据选择、课程和评估都假设我们可以在训练之前知道模型将改进哪些问题。我们直接检验这个假设。对于两个基本模型 DeepSeek-R1-Distill-Qwen-1.5B 和 Qwen2.5-Math-1.5B,我们评估了 18 个后训练在多达 1532 个竞赛数学问题上的运行,每个问题有许多样本,并将训练之前可用的信号与从不相交的运行子集之间的一致性得出的噪声上限进行比较。三个发现适用于两个基本模型。 后训练修复的内容是共享的:独立运行同意很少解决的问题得到改善,噪声上限约为 0.9,但两个基本模型仅在 rho=0.25 时彼此一致 - 共享组件属于基本模型,而不属于问题。先验信号捕获了其中的一小部分:基本通过率、正确解决方案的可能性、较大模型的通过率及其组合仅解释了可解释增益方差的 0.30 和 0.24。现有的检查点是更好的预测器:来自另一个系列的单个检查点的每个问题增益比每个先验信号(单独或组合)更好地预测新的运行(相对于组合信号,分别为 0.52 与 0.33 和 0.34 与 0.17)。结论适用于 2025-2026 年比赛以及每次比较两侧的基线都是独立估计的问题。我们建议将噪声上限作为每个问题信号的标准伴侣。