论文

让护栏失声:基于动态上下文表征消融的推理时越狱攻击

Silencing the Guardrails: Inference-Time Jailbreaking via Dynamic Contextual Representation Ablation

模型推理解码与生成控制

摘要

尽管大语言模型(LLM)已取得卓越性能,但仍易受绕过安全约束的越狱攻击。现有策略从启发式提示工程到计算密集型优化,往往在有效性与效率之间面临显著权衡。在本工作中,我们提出上下文表征消融(Contextual Representation Ablation,CRA),一种旨在动态使模型护栏失效的新型推理时干预框架。基于拒绝行为由模型隐藏状态中特定低秩子空间介导这一几何洞察,CRA在解码过程中识别并抑制这些诱发拒绝的激活模式,无需昂贵的参数更新或训练。在多个安全对齐的开源LLM上的实证评估表明,CRA显著优于基线方法。这些结果暴露了当前对齐机制的内在脆弱性,揭示安全约束可以被精确地从内部表征中消融掉,并凸显了亟需更鲁棒的防御来保护模型潜在空间。

让护栏失声:基于动态上下文表征消融的推理时越狱攻击:论文配图
图 2:上下文表征消除 (CRA) 框架概述。 CRA 在自回归解码期间动态识别和抑制拒绝诱导激活。对于每个生成的标记,框架计算拒绝逻辑的梯度,以将隐藏状态组件归因于低维“拒绝子空间”。然后应用有针对性的神经元掩蔽来中和这些成分,在不修改权重的情况下引导模型走向顺应响应。