论文

对话系统中用户对AI的不当行为如何发生及其影响是什么?

How User-AI Mistreatment Occurs and Matters in Conversational Systems?

模型评测安全与风险评测

摘要

安全研究通常关注模型生成的有害内容,但用户也可能直接对模型施加敌意、胁迫和对抗性压力。理解这些行为的发生机制和情境对准确解读模型行为、对齐漂移及现实部署风险至关重要。本文审计了777K条英文LMSYS-Chat-1M对话数据,使用两个独立检测器:一个八类词典用于检测针对模型的敌意,以及数据集的审核信号;结果显示二者捕捉了不同且仅有弱重叠的现象。词典识别出针对助手的辱骂、威胁和越狱胁迫,而审核信号主要捕获的是诱导有毒内容的请求,而非针对模型的敌意。两者合计标记了约5%的用户发言;按实测精确率校正较窄的词典与骚扰检测并集后,针对助手的不当行为比例为0.90%。这些绝对数值反映的是类似“竞技场”评估中的流量情况,不应被解读为实际部署中的普遍发生率。我们发现,用户敌意在不同模型间差异达13倍,主要受模型吸引的用户群体影响,而非模型行为本身:首轮敌意的传播范围远大于后续响应后的敌意,即使去重首轮提示,极端情况仍相差超过十五倍。在对话内部,助手道歉与下一轮敌意的发生概率显著正相关,该效应在排除被拒绝的前序发言和仅限无越狱对话的条件下依然存在,且在23个模型中的20个为正相关。然而,尽管部分模型更倾向于道歉,这些模型整体仍收到更少的敌意。此外,敌意也表现出时间结构特征:胁迫性开场通常集中在第一轮,而情感性敌意则在会话过程中逐步累积。我们公开了该词典、检测器交叉验证流程以及所有生成的表格。