论文

通过能量驱动的潜在冲突检测来解决指令冲突

Combating Instruction Conflict via Energy-Driven Latent Conflict Detection

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 越来越多地使用分层指令进行部署,但它们仍然容易受到用户指令覆盖系统级约束的冲突的影响。现有的防御机制主要集中于静态输入检查,因此无法检测响应漂移,即尽管输入看似合规,但模型的最终响应违反系统级约束的现象。为了弥补这一差距,我们引入了 ELCD,这是一种用于生成后、交付前验证的响应级潜在冲突检测器。给定完整的生成输出,ELCD 通过将最终词元嵌入与均值池响应嵌入连接起来构造复合隐藏状态表示。然后,它优化成对的边缘排名目标,以区分潜在空间中的合规响应和漂移响应。对 1.5B 至 14B 参数范围内的五种主流 LLM 进行的广泛实验表明,ELCD 的性能显着优于竞争基准。值得注意的是,它将 Llama-2-7B 上的 PR-AUC 提高了约 30 个百分点,并将 Mistral-7B 上 95% TPR (FPR95) 的假阳性率降低至 2.67%。这些结果表明,ELCD 为开放式或自托管 LLM 部署中的潜在指令冲突检测提供了一种有前途的方法。