论文
推理时的引导指令层次结构
Steering Instruction Hierarchies at Inference Time
摘要
指令层次结构是语言模型部署的核心安全假设:较高优先级的输入(例如系统提示)应该覆盖来自用户或工具的冲突的较低优先级输入。然而前沿 LLM 经常违反这个层次结构。我们引入了 V-Steer,这是一种 无需训练 推理时间方法,它通过在提示位置编辑缓存的值向量来恢复特权影响。在第一个下一个词元预测上使用直接 logits 归因,V-Steer 识别较低优先级跨度主导特权跨度的头,然后通过对缓存的 V 张量进行就地乘法编辑来提升特权跨度并抑制冲突的较低优先级跨度。由于该方法仅作用于缓存的值,因此它仍然与融合注意力后端兼容,并且仅增加一次性预填充开销。在从 7B 到 70B 的模型中,这种归因引导干预将受控角色冲突基准上的主要约束准确度从 18% 以下提高到 92%,并且在更广泛的指令层次结构评估上大大优于仅提示基线,同时在 LLM 的 4 个尺度中的 3 个上匹配或超过基于 SoTA 训练的方法,而解码速度开销可以忽略不计。代码可在 https://github.com/cindy2000sh/v-steer 获取。