超越注意力稳定边界:智能体自合成推理协议
Beyond the Attention Stability Boundary: Agentic Self-Synthesizing Reasoning Protocols
摘要
随着大语言模型(LLM)智能体转变为自主数字同事,在非线性多轮对话中保持确定性的目标导向已成为一个架构瓶颈。我们在仅解码器自回归 Transformer 中识别并形式化了一种称为注意力闩锁(Attention Latch)的系统性失效模式。这一现象是信息过度压缩(Information Over-squashing)的行为表现:当历史上下文的累积概率权重压过任务中途的更新时,智能体便会锚定在过时约束上,即便收到明确矛盾的指令也无动于衷。我们提出自合成推理协议(Self-Synthesizing Reasoning Protocols, SSRP),一个元认知框架,将高层架构规划(Architect)与逐轮程序化执行(Executive)离散分离。我们在 9K 条轨迹上评估 SSRP,使用 MultiWOZ 2.2 数据集和聚合枢轴准确率(Aggregate Pivot Accuracy, APA)——这一新指标通过将其分数映射到 U 形“Lost in the Middle”曲线得到验证。我们呈现了三个实验层级:浅层的基于新近性的检索试点、高熵 SOP,以及语义劫持的三跳多事实合成任务。我们的结果从实证上定位了注意力稳定边界(Attention Stability Boundary):在该边界处,GPT 5.4 的无状态 Vanilla ReAct 基线成功率崩塌至 0.1%,而 SSRP 实现了 715 倍的韧性提升。我们在 Gemini 3.1 Pro、Claude Sonnet 4.6 和 DeepSeek V3.2 上展示了具有统计显著性的增益。审计通过三种方式证实了 SSRP 的必要性:借助递归反思基线(成功率 100%)证明注意力失效的存在;通过等距压力测试(准确率 90%)将闩锁效应与位置偏差解耦;并经由信息瓶颈原理和粒度消融对 SSRP 进行形式化。程序完整性审计(98.8% 遵循率)揭示了一个接地悖论(Grounding Paradox):高稳定性模型在检索-推理污染下因拒绝产生幻觉而失败。
