论文

上下文证据遵循的改善主要借助已有机制:审查GRPO、SFT和DPO

Context-Grounding Gains Are Mediated by Pre-existing Machinery: Auditing GRPO, SFT, and DPO

模型评测模型行为与机制分析

摘要

当提示中的证据与记忆知识冲突时,语言模型可能忽略证据。后训练可改善证据遵循,但收益来自新机制还是已有机制增强仍不清楚。我们从同一检查点比较涵盖GRPO、SFT和DPO的九组训练,并把关键比较扩展到不同规模与模型家族;训练前先估计证据遵循的表示方向。五种GRPO变体收益较小,对跨随机种子复现的两种变体,即便奖励指标上升,等价性检验仍将收益限制在冲突SFT以下。冲突SFT带来适度改善,DPO在匹配分布上接近上限。两者大多使用与起始模型相同的一组因果注意力头。减去起始方向会抑制收益,加到起始模型则在通过所述副作用检查的强度下恢复35%的DPO收益。监督热启动使上下文答案更多出现在采样轨迹后,同一GRPO方案几乎不再增加证据遵循收益。在这些设置中,改善主要依赖起始模型已有机制。