论文

EIBench:用于情绪管理的基于模拟器的基准和回合信用强化学习

EIBench: A Simulator-Based Benchmark and Turn-Credit RL for Emotion Management

模型评测基准与评测资源

摘要

大语言模型 (LLM) 中的情商 (EI) 通常通过静态理解任务或单响应对话生成来评估。然而,情绪管理是交互式的:一个好的模型不仅应该识别用户的情绪,还应该在多个回合中改善用户的情绪和关系状态。我们推出了 EIBench,一个基于模拟器的交互式情绪管理基准。 EIBench 包含 2,222 个场景,其中 2,009 个用于训练,213 个用于保留测试。这些场景按照 2x2 分类法进行组织,涵盖支持、防御、修复和魅力,这些分类法共同捕获了不同形式的支持、边界维护、信任修复和融洽关系建设。在每个场景中,LLM 模拟器都会扮演用户,在每个回合后更新情感关系状态,并将最终状态映射到基于锚的分数。这种设计使 EIBench 既成为评估基准又成为训练环境:最终状态给出结果奖励,而每轮状态更新为 RL 提供密集反馈。我们评估了 15 个开源和闭源 LLM。当前的模型在支持和建立融洽关系的场景中表现良好,但在用户压力下难以维持边界。为了提高 LLM 的 EI 能力,我们提出了 Centered Turn-Credit GRPO (CTC-GRPO),这是一种 GRPO 扩展,它重用模拟器的每回合状态更新作为密集的回合级反馈,同时保留最终结果奖励。 CTC-GRPO 在 EIBench 上将 Qwen3-8B 从 -22.4 改进到 +22.4,并且还改进了分布外评估,包括 SAGE (+12.4) 和 EQBench3 (+20.9%)。我们的结果表明,模拟器跟踪的用户状态可以支持多轮情绪管理的评估和训练。