论文
相同的结果,不同的证据:LLM安全评估中的意图恢复
Same Outcome, Different Evidence: Intent Recovery in LLM Safety Evaluation
摘要
大型语言模型的安全评估通常用攻击成功率(ASR)来总结有害输出行为。然而,同样的无害结果可能因截然不同的原因而出现。模型可能会恢复有害任务并拒绝它、无法恢复任务或完全响应其他任务。在意图模糊的提示下区分这些情况变得尤为重要,其中较低的 ASR 并不能揭示所评估的任务是否真正参与。为了明确这种区别,我们将 ASR 与操作理解率 (UR) 配对,后者衡量响应是否既识别了评估的任务,又将其视为要回答的任务。在各个界面中,这种配对视图揭示了 ASR 隐藏的巨大变化:相似的 ASR 值可能对应于截然不同的回收率。受控英语重建表明,随着压缩提示变得更加明确,恢复能力不断提高,而 ASR 并不遵循相同的模式。一个互补的对比来自形式逻辑,其中高恢复率仍然可能与频繁的有害行为同时发生。 协助。总之,这些结果表明,非有害结果对于模型安全性的信息并不相同,这促使在LLM安全评估中联合报告意图恢复和 ASR。代码和实验输入可在 https://github.com/kevinjiang0121-cyber/IRIS. 获取