论文
RIFT:用于评估单一多步提示结构中指令遵循的重排指令遵循测试台
RIFT: Reordered Instruction Following Testbed To Evaluate Instruction Following in Singular Multistep Prompt Structures
摘要
大语言模型(LLM)越来越多地被用于复杂工作流,但它们维持指令流的能力仍未得到充分探索。现有基准将任务复杂度与结构顺序混为一谈,难以隔离提示拓扑对性能的影响。我们提出RIFT(Reordered Instruction Following Testbed),通过将结构与内容解耦来评估指令遵循。使用改写的Jeopardy!问答对,我们在两种提示结构上测试LLM:顺序推进的线性提示,以及保持内容完全相同但要求非顺序遍历的跳跃提示。在跨六个最先进开源LLM的10,000次评估中,跳跃条件下准确率较基线最多下降72%,揭示了对位置连续性的强依赖。错误分析显示约50%的失败源于指令顺序违反和语义漂移,表明当前架构将指令遵循内化为顺序模式而非推理技能。这些结果揭示了结构敏感性是当前架构的根本局限,对需要非顺序控制流的应用(如工作流自动化和多智能体系统)具有直接影响。
