论文
IH-Challenge:改进前沿LLM指令层级的训练数据集
IH-Challenge: A Training Dataset to Improve Instruction Hierarchy on Frontier LLMs
摘要
指令层级(IH)定义LLM在冲突时如何排列系统、开发者、用户与工具指令的优先级,为解决指令冲突提供具体的信任排序策略。IH是防御越狱、系统提示窃取与智能体提示注入的关键。但稳健的IH行为难以训练:IH失败会与指令遵循失败相混淆,冲突可以很微妙,模型还可能学会过度拒绝之类的捷径。我们引入强化学习训练数据集IH-Challenge来应对这些困难。以在线对抗样本生成在IH-Challenge上微调GPT-5-Mini,在16个分布内、分布外与人工红队基准上平均提升IH稳健性+10.0%(84.1%→94.1%),把不安全行为从6.6%降至0.7%且提升通用安全评估上的有用性,并使内部静态智能体提示注入评估饱和,能力回退极小。我们发布IH-Challenge数据集(https://huggingface.co/datasets/openai/ih-challenge)以支持稳健指令层级的后续研究。
