论文
YFPO:具有神经元引导奖励的轭状特征偏好优化
YFPO: Yoked Feature Preference Optimization with Neuron-Guided Rewards
摘要
偏好优化已成为广泛使用的后训练范式,用于提高大语言模型的推理能力。现有方法通常从偏好和不偏好的响应中学习作为外部行为监督,而很大程度上忽略了模型内部表示中编码的与能力相关的信号。在这项工作中,我们研究这些内部信号是否可以为数学推理提供有用的辅助监督。我们引入了 YFPO(Yoked 特征偏好优化),这是一种神经元引导的偏好优化框架,它将响应级偏好学习与神经元级奖励结合起来。 YFPO 首先使用 AttnLRP 来识别与数学相关的内部特征,然后从这些神经元在首选和不首选反应之间的激活裕度中得出辅助奖励。该奖励与标准偏好优化目标相结合,鼓励模型将外部偏好与内部数学相关特征保持一致。我们使用紧凑的语言模型在 GSM8K 上进行了小规模实验。结果表明,神经元引导的奖励可以影响偏好优化动态,并在多种设置中产生可测量的改进,这表明内部表示可以作为面向推理的 后训练 的轻量级且可解释的信号。