论文

鲁棒批评器:防御LLM多轮攻击

Robust Critics: Defending LLMs Against Multi-Turn Attacks

模型推理推理验证与自校正

摘要

当用户向语言模型提出有害请求时,这是真攻击还是被误解的善意提问?这种含糊是LLM安全的核心挑战之一。把情况往坏处想的模型伤害合法用户;往好处想的模型易被利用。该问题在多轮对话中加剧:攻击者的真实意图可能只在多轮交换中渐显,而现有安全框架采用上下文赌博机式处理、无视对话轨迹。为此我们提出对话批评器引导采样(DCGS):在对话每一轮推断用户意图。DCGS不套用关于安全与否的固定规则,而是基于完整对话历史学习用户意图可能是什么、并据此生成响应。形式上,我们把对抗对话建模为马尔可夫决策过程,在单个token与整句话语两个层级学习价值与基于遗憾的批评器,经动作价值批评器为候选响应打分。我们证明这种推理时重加权近似基策略的指数倾斜,保证任意有限候选池的期望回报改进——群相对目标不具备该性质。在CARES-18k、WildJailbreak、Redbench与Harmbench上,DCGS在对抗对话任务上超过强鲁棒基线与前沿模型;DCGS还迁移到前沿模型,无需微调即改善其鲁棒性。

鲁棒批评器:防御LLM多轮攻击:论文配图
图 1:批评者加权重采样。冻结的基础LLM生成KK意图假设;评论家 QphiQ_{\phi} 对每个进行评分; ztz_{t} 是从分数上的 softmax 分布中采样的。