论文
LongGuard:安全护栏长上下文失效的机制分析与免训练缓解
LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails
摘要
安全护栏是抵御大语言模型 (LLM) 有害输入和输出的最后一道防线,但它们几乎完全是在短文本上进行训练和评估的。我们提出了 LongGuard,这是一个评估、机械分析和缓解长上下文护栏故障的框架。我们将任务表述为安全大海捞针(SafetyNIAH),其长度为 0.25k-32k 的网格;在 15 个主流护栏中,不安全召回率平均单调下降超过 50%,配对良性填充与针重复设计将失败归因于不安全针的比例稀释而不是绝对长度。对六个护栏的三层注意力-逻辑-行为分析定位了机制:不安全针上的注意力质量被稀释,不安全-安全之上的逻辑边界被同步压缩,检测决策相应崩溃,这条注意力->逻辑->行为链在部分长度后保持一致。我们进一步隔离了一组稀疏的警卫专用检索头,这些检索头表现出相对于其基本模型的部分特异性。基于分析,我们提出了两种免训练缓解措施——分块检测(CD)和注意力头锐化(AHS)——以及一种部署协议——上下文感知超参数路由(CAHR),该协议根据上下文长度和审计端选择配置。在涵盖合成数据、长上下文攻击和推理模型输出的五个基准测试中,CAHR-CD 和 CAHR-AHS 分别将六项护栏平均值提高了 22% 和 13%。代码和数据可在线获取。
