论文

LLM 知道约束但不使用它:实用约束推理中的激活瓶颈

LLMs Know the Constraint But Do Not Use It: Activation Bottlenecks in Pragmatic Constraint Reasoning

模型评测模型行为与机制分析

摘要

当显着的表面线索与隐式可行性约束竞争时,LLM 通常会失败 - 但聚合精度将真正的约束推断与保守的默认值混为一谈。我们将这种区别形式化为条件约束激活:约束在存在约束和不存在约束的提示(对称性)之间对称地进行内部编码(知识),但仅有时路由到决策(路由)并可通过捐赠者激活进行修复(修复)。对 14 个模型的四重诊断揭示了两种故障模式;两个开放权重上的探针解码了 $88\%$ 以上的约束,但激活修补修复了一个 ($+6.4$ nats) 而不是另一个 ($-0.07$)。在缓解边界上,没有任何提示性干预能够到达修复角落:所有这些都通过单一调解途径(先决条件提及)来扩大保守偏见。隐藏约束故障是一个路由问题,而不是一个知识问题。