论文
IHDec:用于保护多轮指令层次结构的发散引导对比解码
IHDec: Divergence-Steered Contrastive Decoding for Securing Multi-Turn Instruction Hierarchies
摘要
在处理具有不同角色级别优先级的多源输入时,大语言模型 (LLM) 通常无法维护指令层次结构 (IH),在冲突期间矛盾地遵循较低优先级指令。虽然现有的防御措施可以缓解这个问题,但它们在很大程度上仅限于单回合场景,并且需要昂贵的 微调。在本文中,我们通过 Jensen-Shannon Divergence (JSD) 框架在多回合环境中形式化了这种故障模式,揭示了一种普遍存在的角色影响反转现象,即下级输入覆盖上级角色。为了在没有训练的情况下纠正这个问题,我们提出了 IHDec(指令层次引导解码)。 IHDec 利用 JSD 自动检测 词元级 层次结构违规,并动态执行对比解码以抑制未对齐的从属角色。广泛的评估表明,IHDec 在多回合冲突中优于基于训练的基线,同时完全保持总体响应质量。此外,IHDec 增强了针对对抗性即时注入的安全性,并与更大的模型表现出强大的扩展协同作用。该代码可在 https://github.com/nxcolelxu/IHDec.git 获取