论文
GRACE:面向高效后训练的梯度对齐推理数据筛选
GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training
摘要
现有的推理数据筛选流水线对整条样本打分,将每个中间步骤视为同等有价值。实际上,轨迹内的各步骤贡献非常不均,要选好推理数据就必须对它们逐一评估。我们提出GRACE,一种梯度对齐的筛选方法,它将每条推理轨迹视为一串优化事件,并用两个互补信号为每一步打分:该步与面向答案的梯度方向的对齐程度,以及它与前文推理轨迹的一致性。步骤级分数被聚合为样本级价值以用于子集选择,只使用模型内部的优化信号,不需要外部奖励模型或步骤标注。为实现可扩展性,GRACE引入一个表示级的梯度代理,能在单次前向传播中从词元级上游信号估计步骤级对齐度。在MMathCoT-1M上对Qwen3-VL-2B-Instruct进行后训练时,GRACE用20%的数据达到全量数据性能的108.8%,仅用5%的数据仍保持100.2%,且所选子集能有效地跨模型骨干迁移。
