论文
指令层级断裂之处:诊断与修复推理模型中的失败
Where Instruction Hierarchy Breaks: Diagnosing and Repairing Failures in Reasoning Language Models
摘要
代理工作流中部署的推理语言模型必须遵循指令层次结构:当来自不同来源的指令发生冲突时,模型应遵循最高权限的适用指令。现有的基准主要是端到端地衡量这种行为,询问最终的响应是否合规。然而,不合规的响应可能是由几种不同的失败引起的:模型可能无法识别上下文中的相关指令,无法解决已识别指令之间的冲突,或者在其推理中正确解决冲突,但仍然产生违规响应。我们引入了一个白盒诊断框架,将指令层次结构故障定位为指令识别、冲突解决和响应实现,使故障更容易解释。我们评估了三种推理模型——Gemma-4-31B-IT、Qwen3.6-35B-A3B 和 Claude Sonnet 4.6——对 IHEval 和 IHChallenge 的长上下文适应,并发现主要的失败模式因模型、任务和上下文长度而异。基于模型通常可以在明确提示时检测到冲突和输出违规的观察结果,我们提出了两种免训练的自我监控机制:用于生成前低延迟冲突检测的并行输入监视器,以及用于响应级别审查和修复的顺序输出监视器。在 Gemma-4-31B-IT、Claude Sonnet 4.6 和 GPT-5.3 中,最强大的监控器将不遵守规则的情况减少了 81-99%,GPT-5.3 在静态攻击下减少了 86%,在自适应攻击下减少了 45%。
