论文

你不能偏爱你不采样的情绪:DPO 调整的 LLM 中的强度下冲

You Can't Prefer Emotions You Don't Sample: Intensity Undershoot in DPO-Tuned LLMs

模型训练偏好优化

摘要

要求语言模型“非常兴奋”地做出反应,它的输出通常只是稍微更有活力。我们量化了这种影响。我们将指令调整的 LLM 置于连续效价-唤醒 (VA) 目标上,其中效价测量状态的愉快程度和唤醒程度,使用冻结回归量测量所达到的效果,并将请求的目标从 -1 扫到 +1。响应的变化远远小于要求的变化:在 Llama-3.1-8B 上,增益(即相对于所要求的情感所实现的斜率)仅为 0.26,对于效价而言仅为 0.26,对于唤醒而言仅为 0.13,其中忠实的控制者将得分 1。该模型系统地低于所要求的情绪强度,这为 Fazzi 等人的定性观察奠定了基础。 (2025)。我们的实验将其追溯到偏好学习管道。来自自然语料库(例如 EmoBank)的训练目标是中性偏重的,并且样本候选者本身很少达到极端影响,因此直接偏好优化(DPO)没有极端样本可供选择。相反,如果我们均匀地覆盖目标空间并采样一个更热、更大的候选池,效价增益将从 0.26 上升到 0.40 +/- 0.02(3 个种子),并且外推误差下降,而分布内成本却适中(EmoBank 测试 VA 距离 0.092 到 0.107)。相同的配方在 Qwen3-8B 上重现(gain_v 0.44,保留分布内精度)。唤醒更加困难且不太可靠:其增益平均而言几乎没有变化,并且在种子之间波动(0.14 +/- 0.07,相对于效价的严格+/- 0.02),因为提高唤醒需要基础模型不愿意生成的候选者。证据表明,忠实强度的瓶颈是候选池的极端性,而不是调节格式。