论文

在不失去一致性的情况下恢复多样性:训练后 LLM 的 DPO 秘诀

Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs

模型训练偏好优化

摘要

许多开放式指令都有多个有效答案,用户可以从中受益,但 后训练 通常将 LLM 的输出空间缩小为一小组规范响应。我们引入了 REDIPO,这是一种离线 DPO 数据构建管道,用于恢复不同的有效答案模式,同时保留指令模型的对齐优势。对于每个提示,REDIPO 都会对来自基础模型和指导模型的响应进行采样,用指导模型重写基础模型响应,筛选候选者的安全性和指令遵循质量,并构建偏好对,以支持具有类似指令遵循奖励的候选者之间略有不同的响应。在 Qwen3-4B、OLMo-3-7B 和 LLaMA-3.1-8B 中,REDIPO 相对于指令检查点将 NoveltyBenchdistinct_k 提高了 134%、33% 和 44%,而 DivPO 在相同模型上将多样性改变了 0%、-6% 和 -4%。这些增益很大程度上维持了 MTBench、IFEval 和 Arena-Hard 的性能,并降低了直接类别 HarmBench 的攻击成功率。消融表明,边际多样性对选择和碱基响应重写推动了多样性增益,而过滤和质量限制配对有助于保持一致性。总体而言,我们的结果表明,可以通过精心构建的偏好数据重新引入来自基础模型生成的各种有效答案,同时保留 后训练 的对齐优势。我们在 https://github.com/vsamuel2003/ReDiPO 发布了我们的代码和数据。