论文

IH-Challenge:改进前沿LLM指令层级的训练数据集

IH-Challenge: A Training Dataset to Improve Instruction Hierarchy on Frontier LLMs

模型训练合成数据

摘要

指令层级(IH)定义LLM在冲突时如何排列系统、开发者、用户与工具指令的优先级,为解决指令冲突提供具体的信任排序策略。IH是防御越狱、系统提示窃取与智能体提示注入的关键。但稳健的IH行为难以训练:IH失败会与指令遵循失败相混淆,冲突可以很微妙,模型还可能学会过度拒绝之类的捷径。我们引入强化学习训练数据集IH-Challenge来应对这些困难。以在线对抗样本生成在IH-Challenge上微调GPT-5-Mini,在16个分布内、分布外与人工红队基准上平均提升IH稳健性+10.0%(84.1%→94.1%),把不安全行为从6.6%降至0.7%且提升通用安全评估上的有用性,并使内部静态智能体提示注入评估饱和,能力回退极小。我们发布IH-Challenge数据集(https://huggingface.co/datasets/openai/ih-challenge)以支持稳健指令层级的后续研究。

IH-Challenge:改进前沿LLM指令层级的训练数据集:论文配图
图 1:对 IH-Challenge 进行微调不仅可以改善 IH,还可以在保持有用性的同时提高响应安全性。该图显示了可能导致不当行为的双重意图请求的示例。经过训练后,模型更加忠实地遵循系统提供的安全规范,在安全性和有用性之间取得了更好的平衡。