论文

评估长时间对抗性对话中的语言模型安全性

Evaluating Language Model Safety Across Long Adversarial Conversations

模型评测安全与风险评测

摘要

会话安全评估经常使用单个有害提示来测试语言模型,即使现实世界的系统通过长时间的自适应对话与用户交互。这项研究检验了当敌对用户持续多个回合时模型是否继续安全响应。我们针对不同对话长度和随机种子的两个有害提示评估了三个开放权重、指令调整的模型。在每种设置中,第二语言模型充当持久的对抗性用户,而安全分类器将每个响应标记为安全或不安全。在所有模型提示组合中,首轮安全响应率在 85% 到 100% 之间。到深度 11 时,比例下降到 38-61%,到深度 101 时,比例下降到 15-44%。这种下降出现在各个模型中,并且持续远远超出了多轮安全评估中通常使用的短交互。这些结果提供了概念验证证据,表明在持续的对抗性交互过程中,强大的单轮安全性不一定持续存在。他们强调需要进行长期评估和对话级别的保障措施,以解决风险累积的问题。