论文
从提示风险到响应风险:大语言模型安全行为配对分析
From Prompt Risk to Response Risk: Paired Analysis of Safety Behavior of Large Language Models
摘要
大语言模型 (LLM) 的安全评估通常报告二元结果,即攻击成功率 (ASR)、拒绝率或有害与安全分类,这隐藏了提示和响应之间风险如何变化。我们对四个伤害类别(性、自我伤害、仇恨和暴力)和顺序严重性级别(安全、低、中、高)的人类标记提示和响应记录进行配对分析。 61% 的回复相对于提示减少了伤害,36% 保持严重性,3% 升级。升级分为两种机制:良性提示触发未经请求的有害细节,以及以比提示更严重的方式继续执行任务的答案。类别分解表明,性内容在该样本中表现出最高的危害持久性,这是由相同严重程度的合规性驱动的,而不是偏离良性输入的。联合相关性分析揭示了有益与无害的权衡:合规升级仍然高度相关,而安全响应包括相关性较低的一般拒绝。超过 600 个提示和六个模型的公共支持评估再现了框架的测量结果和两个方向信号,而少量 LLM 分级机表现出数据校准无法消除的提示/响应检测不对称性。评分器提示、公共评估工件和分析代码在 https://github.com/microsoft/PairedSafety 上共享。