论文
超越浅层安全的推理时漏洞:沿生成维度的对齐
Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories
摘要
与安全相关的大型语言模型 (LLM) 在推理过程中仍然容易受到干预,从而将生成重定向到有害输出。最近的工作将此归因于浅层安全性,其中对齐集中在前几个输出标记中。我们证明浅层安全性是更广泛的推理时间漏洞的特例,其中任何生成步骤的短词元注入都可以极大地改变后续的安全行为。我们还发现,模型在其隐藏状态中与拒绝方向的对齐并不能预测其对此类注入的鲁棒性,这表明仅内部状态并不能决定扰动下的生成行为。为了解决这个问题,我们直接在通过模拟中序列扰动构建的生成轨迹上对齐模型,并表明这提高了中序列注入的鲁棒性,并推广到利用早期词元生成的攻击。我们的工作认为,强大的安全协调需要对生成过程本身进行训练,而不仅仅是其输出。
