论文

并非所有偏好都是平等的:推理模型的稳定性感知和梯度有效对齐

Not All Preferences Are Created Equal: Stability-Aware and Gradient-Efficient Alignment for Reasoning Models

模型训练偏好优化

摘要

基于偏好的对齐对于训练大推理模型至关重要;然而,像直接偏好优化(DPO)这样的标准方法通常会统一处理所有偏好对,而忽略了训练实例不断变化的效用。这种静态方法通常会导致低效或不稳定的优化,因为它浪费了对梯度可忽略不计的琐碎对的计算,并且受到不确定决策边界附近样本引起的噪声的影响。面对这些挑战,我们提出了 SAGE(稳定性感知梯度效率),这是一种动态框架,旨在通过最大化策略更新的信噪比来增强对齐可靠性。具体来说,SAGE 集成了粗粒度的课程机制,该机制根据模型能力刷新候选池,并具有细粒度的稳定性感知评分功能,优先考虑信息丰富、可信的错误,同时过滤掉不稳定的样本。多个数学推理基准的实验表明,SAGE 显着加速了收敛速度,并且优于静态基线,凸显了策略感知、稳定性意识的数据选择在推理对齐中的关键作用。

并非所有偏好都值得梯度:理解离线推理对齐中的梯度效用
图2:SAGE 总体框架。