论文
鲁棒批评器:防御LLM多轮攻击
Robust Critics: Defending LLMs Against Multi-Turn Attacks
摘要
当用户向语言模型提出有害请求时,这是真攻击还是被误解的善意提问?这种含糊是LLM安全的核心挑战之一。把情况往坏处想的模型伤害合法用户;往好处想的模型易被利用。该问题在多轮对话中加剧:攻击者的真实意图可能只在多轮交换中渐显,而现有安全框架采用上下文赌博机式处理、无视对话轨迹。为此我们提出对话批评器引导采样(DCGS):在对话每一轮推断用户意图。DCGS不套用关于安全与否的固定规则,而是基于完整对话历史学习用户意图可能是什么、并据此生成响应。形式上,我们把对抗对话建模为马尔可夫决策过程,在单个token与整句话语两个层级学习价值与基于遗憾的批评器,经动作价值批评器为候选响应打分。我们证明这种推理时重加权近似基策略的指数倾斜,保证任意有限候选池的期望回报改进——群相对目标不具备该性质。在CARES-18k、WildJailbreak、Redbench与Harmbench上,DCGS在对抗对话任务上超过强鲁棒基线与前沿模型;DCGS还迁移到前沿模型,无需微调即改善其鲁棒性。
