论文
稳健推理的不变梯度对齐 蒸馏
Invariant Gradient Alignment for Robust Reasoning Distillation
摘要
大语言模型 (LLM) 遭受捷径学习的困扰:即使逻辑结构相同,它们也会在语义表面与训练数据不同的分布外 (OOD) 输入上系统性地失败。这破坏了将思维链推理转移给较小学生的 知识蒸馏 管道。我们引入了不变梯度对齐(IGA),这是一种训练框架,通过三项创新来对齐语义多样但逻辑同构的示例中的梯度更新:(i)逻辑异构体集,跨不同语义领域(数学、医学、法律、科学)共享相同逻辑结构的问题组; (ii) 可微的\emph{连续梯度冲突掩模},它抑制具有高跨域梯度方差的参数维度,同时保留不变的方向; (iii) 将掩蔽梯度截断的 SVD 投影回到 LoRA 低秩流形上,始终保持参数效率。理论上,IGA 产生比 ERM 更严格的 OOD 泛化界限,随异构体域的数量缩放,并在温和规律性下以标准 SGD 速率收敛。根据经验,IGA 在四个基准测试中优于八个基线,其准确度比 ERM-SFT 提高了 14.3 个百分点,逻辑一致性得分为 0.031 比 0.142,表示不变性提高了四倍。