论文
LLM 代理中的多层指令层次结构
Many-Tier Instruction Hierarchy in LLM Agents
摘要
大语言模型 代理从许多来源接收指令——系统消息、用户提示、工具输出、其他代理等等——每个来源都具有不同级别的信任和权限。当这些指令发生冲突时,Agent必须可靠地遵循最高权限的指令,以保持安全和有效。主导范例指令层次结构 (IH) 假定由严格的角色标签(例如系统 > 用户)定义的一组固定的、小型的特权级别(通常少于五个)。这对于现实世界的代理环境来说是不够的,在现实世界中,冲突可能会在更多的来源和环境中出现。在这项工作中,我们提出了多层指令层次结构(ManyIH),这是一种解决具有任意多个特权级别的指令之间的指令冲突的范例。我们推出 ManyIH-Bench,这是 ManyIH 的第一个基准测试。 ManyIH-Bench 要求模型能够导航具有不同权限的最多 12 个级别的冲突指令,包括 853 个代理任务(427 个编码和 426 个指令跟踪)。 ManyIH-Bench 组合了由 LLM 开发并经过人类验证的约束,以创建跨越 46 个现实世界代理的真实且困难的测试用例。我们的实验表明,当指令冲突规模扩大时,即使是当前的前沿模型也表现不佳(约 40% 的准确率)。这项工作强调了迫切需要在代理环境中明确针对细粒度、可扩展指令冲突解决的方法。