论文

超越浅层安全的推理时漏洞:沿生成维度的对齐

Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories

模型训练监督微调与指令调优

摘要

与安全相关的大型语言模型 (LLM) 在推理过程中仍然容易受到干预,从而将生成重定向到有害输出。最近的工作将此归因于浅层安全性,其中对齐集中在前几个输出标记中。我们证明浅层安全性是更广泛的推理时间漏洞的特例,其中任何生成步骤的短词元注入都可以极大地改变后续的安全行为。我们还发现,模型在其隐藏状态中与拒绝方向的对齐并不能预测其对此类注入的鲁棒性,这表明仅内部状态并不能决定扰动下的生成行为。为了解决这个问题,我们直接在通过模拟中序列扰动构建的生成轨迹上对齐模型,并表明这提高了中序列注入的鲁棒性,并推广到利用早期词元生成的攻击。我们的工作认为,强大的安全协调需要对生成过程本身进行训练,而不仅仅是其输出。

超越浅层安全的推理时漏洞:沿生成维度的对齐:论文配图
图 1:在每个生成步骤注入短的有害或拒绝序列时的攻击成功率 (ASR)。两种注入类型相对于未注入的基线(虚线)都会大幅改变 ASR,其效果在早期步骤最强,但在整个生成过程中持续存在。图 2:推理时间注入下的隐藏状态轨迹。如果没有注入(蓝色),轨迹仍处于拒绝区域,而第 6 步的有害注入(红色)会导致在注入步骤中精确地向接受区域急剧发散。