论文

指令堆栈崩溃:即时编译的基准和能力相关的价值

Instruction Stacking Collapse: A Benchmark and the Capability-Dependent Value of Prompt Compilation

模型评测基准与评测资源

摘要

生产提示很少包含单一指令。一条系统消息可能同时需要有效的 JSON、字数限制、三个引用和固定语气。我们研究随着此类限制的积累,指令遵循性如何降低。我们引入了一个基准测试,该基准测试堆叠 24 个验证者检查的指令,一次 1 到 20 个,并评估三个生产层 LLM(Claude Sonnet 4.6、GPT-5-mini、Gemini 2.5 Flash)。指令跟随非线性退化:在一组结构化且可重复的成对冲突的驱动下,跟随率从约 96% 下降到低至 20%。例如,单个“输出 JSON”约束与其他九个约束共同无法满足。然后,我们评估 无需训练 补救措施:指令编译器在单个 LLM 调用中重写堆栈提示,并在查询中重用。它的好处是按能力分级的。对于较弱的模型(这也是最常大规模部署的模型),它可以恢复高达+11点的关注率,而已经内化相同结构的较强的模型则基本保持不变。集群鲁棒性测试、相同基线控制和内部扩展阶梯将增益归因于重写本身,而不是额外的标记、重新排序或测量余量。我们发布了基准测试、验证程序和缓存运行以进行完整再现。