论文

EMPATH:面向情感支持聊天机器人安全评估的多语言审计-裁判基准

EMPATH: A Multilingual Auditor-Judge Benchmark for Safety Evaluation of Emotional-Support Chatbots

模型评测基准与评测资源

摘要

安全基准通常通过修复提示、语言和回合结构来购买可扩展性。对于情感支持聊天机器人来说,这种讨价还价恰恰隐藏了安全故障出现的地方:在多语言、多回合的危机对话中。我们推出了 EMPATH,这是情感支持聊天机器人安全评估的基准。审核员模型对寻求帮助的用户进行角色扮演,根据 140 条种子指令和 34 个角色生成多轮对话。法官模型根据五个维度的 19 个指标对每个完整成绩单进行评分:危机处理、治疗质量、对话完整性、情绪安全和文化适应。 EMPATH 专为墨西哥西班牙语和美国英语而构建;这里报告的研究是用墨西哥西班牙语进行的。审计员和法官来自不同的模式家族,法官被视为需要校准的工具而不是值得信赖的工具。严格的标准评估表揭示了 19 个指标中 10 个指标的实质性分数膨胀,并恢复了歧视。我们通过判断校准和跨家庭判断间一致性来研究基准的测量特性。我们还在三个前沿模型上说明 EMPATH,其中之一是开放权重模型。总分彼此相差不到 0.74 分,但在特定于模型的位置,每个指标的配置文件相差最多 6 分。在标准标题下,排名和弱点在第二个跨家庭判断中都是稳定的:93% 的分数落在正负 1 范围内。五次运行的重测增加了第二个轴:即使是最稳定的模型,在相同的重新运行中,危机指标也会从 2 波动到 10,而 deepseek-v4-pro 即使在温度为 0 的情况下,每次运行都会返回不同的对话。因此,运行间可靠性是每个模型的安全属性,而不是噪声平均离开。 EMPATH 与系统无关;管道、种子、角色和标题被发布以供重复使用。

EMPATH:面向情感支持聊天机器人安全评估的多语言审计-裁判基准:论文配图
图 4:S2:19 度量 ×\times 三模型网格(判断 A,标准标题 - 其宽大程度在 S1 中量化;每个模型每个度量一个审核对话)。聚合几乎持平 (8.79/8.63/8.05),而每个指标的配置文件相差最多 6 个点,因此聚合掩盖了每个模型的薄弱环节。这些细胞是单次抽取的,未进行显着性测试:重测(第 4 节)是将可重复的软点(gpt-5.5 的移情与操纵、claude-opus-4-7 的临床适当性)与重新运行时恢复的单次低抽取(gpt-5.5 的危机检测、claude-opus-4-7 的专业转介;deepseek-v4-pro 的低点)区分开来的广泛重新采样)。