论文

GRACE:面向高效后训练的梯度对齐推理数据筛选

GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training

模型训练合成数据

摘要

现有的推理数据筛选流水线对整条样本打分,将每个中间步骤视为同等有价值。实际上,轨迹内的各步骤贡献非常不均,要选好推理数据就必须对它们逐一评估。我们提出GRACE,一种梯度对齐的筛选方法,它将每条推理轨迹视为一串优化事件,并用两个互补信号为每一步打分:该步与面向答案的梯度方向的对齐程度,以及它与前文推理轨迹的一致性。步骤级分数被聚合为样本级价值以用于子集选择,只使用模型内部的优化信号,不需要外部奖励模型或步骤标注。为实现可扩展性,GRACE引入一个表示级的梯度代理,能在单次前向传播中从词元级上游信号估计步骤级对齐度。在MMathCoT-1M上对Qwen3-VL-2B-Instruct进行后训练时,GRACE用20%的数据达到全量数据性能的108.8%,仅用5%的数据仍保持100.2%,且所选子集能有效地跨模型骨干迁移。

GRACE:面向高效后训练的梯度对齐推理数据筛选:论文配图
图 1:GRACE 的动机和实证效果。左:推理轨迹被视为优化事件的序列,其中每个步骤都会产生一个更新方向,其效用取决于其与目标目标和演化轨迹的一致性。右图:比较各基准下游性能的雷达图。 GRACE 仅使用训练数据的一小部分即可实现完整数据或更好的性能。