论文
让护栏失声:基于动态上下文表征消融的推理时越狱攻击
Silencing the Guardrails: Inference-Time Jailbreaking via Dynamic Contextual Representation Ablation
摘要
尽管大语言模型(LLM)已取得卓越性能,但仍易受绕过安全约束的越狱攻击。现有策略从启发式提示工程到计算密集型优化,往往在有效性与效率之间面临显著权衡。在本工作中,我们提出上下文表征消融(Contextual Representation Ablation,CRA),一种旨在动态使模型护栏失效的新型推理时干预框架。基于拒绝行为由模型隐藏状态中特定低秩子空间介导这一几何洞察,CRA在解码过程中识别并抑制这些诱发拒绝的激活模式,无需昂贵的参数更新或训练。在多个安全对齐的开源LLM上的实证评估表明,CRA显著优于基线方法。这些结果暴露了当前对齐机制的内在脆弱性,揭示安全约束可以被精确地从内部表征中消融掉,并凸显了亟需更鲁棒的防御来保护模型潜在空间。
