论文

多领域中期训练的覆盖最优点与难被对齐消除的差距

Everything in Moderation: Per-Domain Coverage Optima and Alignment-Resistant Domain Gaps in Multi-Domain Mid-Training

模型评测模型行为与机制分析

摘要

训练中期是预训练和对齐之间的阶段,模型的每个域数据组成通常由数据可用性而不是原则设计来设置。我们询问这个决定会带来什么,以及稍后的调整是否可以撤销它。在受控逻辑推理设置(Qwen3-8B-Base,具有 4B 复制;五个语义上规则不相交的 KOR-Bench 域)中,我们训练跨越五域单纯形的 30 个分配,24 个扫描配置加上 6 个从拟合中保留的配置,每个配置有 5 个种子。出现了三个发现。首先,每个域都有一个最佳的内部覆盖范围:中等范围 ($10\%$-$40\%$) 对于所有五个域都是最好的,二次内部性的校准排列测试给出 $P\approx0.010$;拟合的仅训练中期曲线,8B 峰值在 $9.9\%$ 和 $35.1\%$ 之间,再现曲线形状,但不再现峰值位置。其次,这些差距在固定预算对齐过程中仍然存在:补偿性 SFT 提高了 116/120 个单元格(平均 $+4.32\%$),但在 $5\%$ 阈值下桥接 $0/240$ 对,在 $10\%$ 比率下桥接 $30/240$,等预算统一控制的行为几乎相同,排列零将桥接 $13.8\pm3.3$ 和$77.9\pm8.5$ 对 ($P<0.001$)。第三,零覆盖率会破坏仅训练中的准确性,尽管仅 FineWeb-Edu 的控制显示这种崩溃与通用漂移混合在一起。探索性的 $\theta^*$ 分配获得了最大的全管道收益($+4.36\%$ vs. $+0.80\%$/$+0.64\%$\,pp),但在韦尔奇测试下是微不足道的。