论文
屏蔽高频共享Token改善直接偏好优化
Masking Frequent Tokens Sharpens Direct Preference Optimization
摘要
直接偏好优化 (DPO) 通过优化标记级隐式奖励差异的序列级总和来调整语言模型。然而,我们在这个公式中发现了一个普遍的病态:高频标记类型的一个不成比例的小子集主导了累积序列分数,同时在首选和不首选的响应中对称地出现。具体来说,在 Anthropic HH-RLHF 上的规范 Qwen 标记化下,仅 69 种标记类型占所有响应标记的 $55.1\%$ 和对内共享标记质量的 $85.9\%$,表现出比其余词汇表低得多的偏好侧特异性。这种对称的普遍性会引起梯度纠缠并稀释通过目标传播的辨别性偏好信号。为了解决这个问题,我们引入 Anisotropic DPO (\textsf{ADPO}) 及其规范实现 Frequency-Hard DPO。使用固定的、与标签无关的词汇掩码,我们的方法将高频响应标记的隐式奖励贡献归零,同时为信息位置分配单位权重,从而在不修改偏好对、丢弃上下文或引入学习参数的情况下抑制梯度干扰。这里,各向异性表示非均匀标记级目标权重而不是表征几何。对 AlpacaEval、MT-Bench 和 Arena-Hard 的广泛实证评估表明,Frequency-Hard DPO 在 Qwen-2.5-7B-Instruct 和 Llama-3-8B-Instruct 上始终优于标准 DPO,证实选择性屏蔽共享高频词元为稳健的偏好对齐提供了有效的零开销机制。