论文

大语言模型能遵循指令,但一次遵循不了太多:组合性约束满足中的相变

Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction

模型评测基准与评测资源

摘要

大语言模型越来越多地被部署在需要同时遵守多条显式约束的场景中——推理结构、安全边界、输出模式。单条约束可以被熟练处理,但需要多条共同成立的组合性区域仍缺乏刻画:性能衰减有多快、由什么决定、坍塌能否缓解?我们提出约束饱和评估(CSE),一个程序化生成的基准,系统性地改变同时约束的数量(k),每条约束均由确定性的基于规则的验证器打分,完全不涉及LLM评审:15个模型、36种约束类型、k=1–12下共369,753次检查。得到三项发现。其一,单条约束的通过率平缓且可预测地衰减,而同时满足全部k条约束的概率则坍塌——一个在k=8时单条通过率约41%的模型,八条全过的概率仅为5.7%。其二,不同约束的退化并不均等:结构类约束每增加一条所损失的基线能力是词汇类的2倍,并按一个“理解—维持差距”排序,该差距区分了需要持续追踪的约束与不受组合影响的二元判定。其三,各失败近乎独立,这正是累积呈乘性的原因;确实存在的残余耦合追踪的是共享的输出特征而非成对干扰——错误的句子计数会让所有读取它的约束全部失败。可靠的指令遵循在超过5–6条同时约束后崩溃:最强模型在7条约束时探测级成功率跌破50%,而15个模型中有12个在3条或更少时就如此。

大语言模型能遵循指令,但一次遵循不了太多:组合性约束满足中的相变:论文配图
图5:按模型分列的每约束 mCSR(36 个约束 ×\times 15 个模型)。GPT-5.5 在所有维度上占优(总体 79.8%),随后是 Claude 4.7 Opus(67.0%)和 Flash-Lite(56.6%)。格式–关系簇表现为一个相关块(F1–F3,R1,R3):结构化输出失败的模型会同时无法完成关系推理——这是输出特征耦合,而非认知干扰(第 4 节)。结构类与元类约束(S1,S4,S6,M2)普遍困难(≤15%{\leq}15\%),而词汇约束(L5 禁用词:90%,L2 必需词:80%)和数值约束(N2 无数字:83%)维持了渐近下限。DeepSeek V4 Pro 和 Kimi K2.6 呈现快速衰减模式:跨约束方差大,但在免疫簇之外比率一致偏低。