论文
SELF-EMO:从识别到一致表达的情绪自我进化
SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression
摘要
对话情绪识别(ERC)已成为大语言模型(LLM)在以人为本交互中的一项基础能力。除准确识别外,连贯的情绪表达同样至关重要,但二者都受制于高质量标注数据的稀缺与静态性。在本工作中,我们提出 SELF-EMO,一个建立在“更好的情绪预测会带来更一致的情绪响应”这一假设之上的自我进化框架。我们引入情绪理解与情绪表达两个辅助任务,并设计了一种基于角色的自我博弈范式,让模型同时扮演情绪识别者与对话回应者。通过迭代交互,模型生成多样化的对话轨迹,从而实现可扩展的数据生成。为保证质量,我们采用数据飞轮机制,用平滑的基于 IoU 的奖励过滤候选预测与响应,并将选出的样本回馈用于持续自我改进,而无需外部监督。我们进一步提出 SELF-GRPO,一种利用多标签对齐奖励与组级一致性信号来稳定优化的强化学习算法。在 IEMOCAP、MELD 和 EmoryNLP 上的实验表明,SELF-EMO 取得最先进的性能,Qwen3-4B 准确率提升 6.33%,Qwen3-8B 提升 8.54%,展现出强有效性与泛化能力。
