论文
THRD:针对大语言模型越狱攻击的无需训练多轮防御框架
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
摘要
多轮越狱攻击通过利用逐渐升级和跨轮协调等对话动态,对 LLM 构成越来越大的威胁。现有的防御要么依赖于成本高昂的再训练(通常会降低模型效用),要么在每个回合独立应用单回合分析,无法捕获风险如何沿着交互轨迹累积。我们观察到,多轮交互中的安全行为是依赖于轨迹的:对话历史不断重塑模型的条件环境,使其不足以单独评估每个轮次。受这一见解的启发,我们提出了 THRD,这是第一个 无需训练 框架,它明确模拟了多轮越狱防御的时间风险累积。 THRD 集成了四个模块:用于瞬时风险评估的回合级风险评估器 (TRA)、用于跨回合意图升级检测的历史情境分析器 (HCA)、用于识别辅助输出的响应评估器 (RE),以及通过时间演变评分机制与基于衰减的调制和趋势感知调整将这些信号组合起来的决策模块。针对两个目标模型的最先进的多回合攻击(包括基于树搜索和多代理协作方法)的实验表明,THRD 将 ASR 降低至 0.2--4.0%,同时将 MMLU 和 GSM8K 上的模型效用保持在 1.5% 的降级范围内。消融研究证实了非冗余模块贡献和稳定的跨架构泛化。对首次拒绝触发器的分析表明,超过 70% 的多轮攻击需要 Turn~2 或更晚的时间才能检测到,从而验证了显式时间聚合的必要性。