论文

VA-DPO:语言模型中可控情绪生成的价-唤醒直接偏好优化

VA-DPO: Valence-Arousal Direct Preference Optimization for Controllable Emotion Generation in Language Models

模型训练偏好优化

摘要

我们如何准确地告诉语言模型如何感觉?大多数关于情感生成的工作都用一个离散的标签来回答——快乐、愤怒、悲伤——它不能表达“轻微沮丧但平静”这样的目标。相反,我们将所需的影响指定为价-唤醒平面中的连续点 (v*, a*),并训练模型来击中它。我们的方法 VA-DPO 是对直接偏好优化的一个小修改:冻结的 VA 回归器根据到目标的欧几里德距离对每个采样代进行评分,我们只保留距离间隙清除了边际 tau 的候选对,并且我们使用普通 DPO 损失与冻结参考优化 LoRA 适配器。 DPO 目标本身没有改变;新鲜的是偏好数据的构建方式。在 Llama-3.1-8B-Instruct 上,与系统提示相比,与目标的平均 VA 距离缩短了 33%,与几次提示相比,缩短了 25%,将效价/唤醒相关性提升至 r_v=0.93 和 r_a=0.75。收益会延续到 Qwen3-8B 和 Llama-3.2-3B,并且它们不会以通常的价格出现:MMLU 保持不变 (Delta=+0.0),并且保留 HellaSwag 和 TruthfulQA。我们发布代码、配置和偏好构建管道。