论文
能攻破RLVER吗?探究RL训练共情智能体的对抗鲁棒性
Can You Break RLVER? Probing Adversarial Robustness of RL-Trained Empathetic Agents
摘要
从可验证的情感奖励中进行强化学习 RLVER 已经生成了具有很强同理心表现的语言模型,并在假设用户合作、诚实的基准上进行了评估。然而,真正的情感互动系统地违反了这一假设:用户对人工智能系统进行煤气灯、升级和压力,以进行无条件验证,这是合作基准无法显现的动态。我们构建了对抗性共情基准 AEB 并引入了情感一致性评分 ECS 来评估对抗性条件下的共情鲁棒性。 AEB 包括六种基于心理的对抗轨迹类型,具有惩罚公式化反应的歧视性奖励结构; ECS 正式将模型跟踪用户情绪状态的能力与其改善情绪状态的能力分开。在八个场景匹配条件下的对照实验中(2 个 RLVER 模型和 2 个基础模型(Qwen 1.5B 和 7B)的思考和不思考条件,进行 480 次对抗性对话),RLVER-PPO-Think 的表现明显优于相同规模的未调整基线(0.963 vs. 0.761,\(p<0.001,r=0.688\)),零对话崩溃,隐藏意图检测提高 47%。然而,RLVER-PPO-Think 与 Base-7B-Think 的 ECS 几乎持平,并且没有显着差异 (\(p=0.650\)):RL 训练提高了情绪反应能力,但在可观察状态跟踪方面没有可测量的收益。我们将 ECS-FS(最终分数)差距解释为该模拟器系列内部的行为/易读性分离,而不是作为内部理解或临床准备情况的证据。
