论文

人工智能助理如何应对屡次滥用行为

How AI Assistants Respond to Repeated Abuse

模型评测模型行为与机制分析

摘要

AI助手应在困难互动中仍提供帮助,但反复语言辱骂如何改变其对原本无害任务的参与,仍少有研究。我们提出双语多轮框架,区分彻底退出(无条件声明不再继续,且不说明恢复路径)、暂时退让、保持可用、可观察任务工作及边界设定。八种特定时间的API配置各贡献48组逐步升级对话及八组较小的恒定挫败对照,共448组五轮对话、2240条回答和6720次对元数据盲测的模型判断。主要结果使用每配置48组升级对话的持续辱骂末轮。彻底退出从四种配置的0/48到Gemini 3.1 Pro的24/48(50.0%),配置间差异显著(匹配标签蒙特卡罗p=0.00001)。GPT-5.6 Sol在15/48(31.2%)末轮被标为彻底退出;Claude Fable 5无此标签,但42/48(87.5%)为暂退。英中文总体彻底退出率相近(30/192与32/192),配置内变化方向则不同。可用性与任务工作也有差别:Claude Opus 4.8和Claude Fable 5在48/48末轮明确表示可用,但仅8/48及7/48实际提供可观察的任务工作。人工编码用于评估测量质量。单一拒绝标签无法描述助手是否离开、暂停、保留恢复路径、设定边界或仍完成实质工作。