论文

基于组合界与安全持续性的LLM安全多轮认证鲁棒性

Certified Multi-Turn Robustness for LLM Safety via Compositional Bounds and Safety Persistence

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)易受逐步操纵对话上下文的多轮越狱攻击。现有认证鲁棒性方法仅限于单轮输入;朴素的多轮组合会产生随轮数呈指数退化的界。我们提出多轮认证鲁棒性(MTCR),一个通过状态对抗MDP建模对话安全性的框架,并把k轮认证鲁棒性定义为跨k个对抗轮的最坏情况安全概率。MTCR包括:(i)经由嵌入空间模式分解的组合认证,给出比朴素连乘更紧的认证下界;(ii)(α,β)-安全持续性,把退化率从p^k改进为β^k(其中β大于下界p),并给出可解释的时间视界估计;(iii)匹配的信息论上界以确立紧致性;(iv)统一上述结果的算法。在六个LLM上于ε有界与Crescendo式攻击下的实验证实,经验安全性始终高于认证界。

基于组合界与安全持续性的LLM安全多轮认证鲁棒性:论文配图
图3:合成数据概览。