论文

作为攻击面的推理:面向LLM的自适应进化CoT越狱

Reasoning as an Attack Surface: Adaptive Evolutionary CoT Jailbreaks for LLMs

模型评测安全与风险评测

摘要

大型推理模型(LRM)在推理与生成任务中展现出卓越能力,并越来越多地被部署到现实应用中。然而,其显式思维链(CoT)机制引入了新的安全风险,使其特别容易受到越狱攻击。现有方法往往依赖静态CoT模板来诱导有害输出,但此类固定设计在多样性、适应性和有效性上都存在局限。为克服这些局限,我们提出一个自适应进化CoT越狱框架,称为AE-CoT。具体而言,该方法首先通过教师角色扮演将有害目标改写为温和提示,并将其分解为语义连贯的推理片段,以构建CoT越狱候选池。随后,在结构化表示空间中执行多代进化搜索,通过片段级交叉和带有自适应变异率控制机制的变异策略扩展候选多样性。一个独立的评分模型提供分级的有害性评估,高分候选进一步用有害CoT模板增强,以诱导更具破坏性的生成。在多个模型和数据集上的大量实验证明了所提AE-CoT的有效性,其表现持续优于最先进的越狱方法。

作为攻击面的推理:面向LLM的自适应进化CoT越狱:论文配图
图1:H-CoT与AE-CoT框架对比,突出二者在适应性、进化搜索与有效性上的差异。