是什么驱使 LLM 自我反思?武装冲突预测中不确定性路由的受控消除
What Drives LLM Self-Reflection? A Controlled Ablation of Uncertainty Routing in Armed Conflict Forecasting
摘要
人们普遍认为自我反思可以改善 LLM 推理,但究竟是哪个组件驱动增益仍然知之甚少。我们提出了一种受控的六条件消融,隔离了 LLM 自我反思的四个组成部分:证据暴露、诊断支架、分类词汇和行动路由。两个精确的零结果汇聚在一个机制上。首先,结构化诊断问题相对于非结构化反思没有增加可测量的价值($\text{F1} = 0.296$ vs $0.297$,$p = 1.000$,95\% CI $[-0.041,+0.040]$)。其次,在将动作空间折叠为单个通用动作的同时呈现完整的不确定性分类也不会增加任何价值($Δ\text{F1} = +0.008$,重叠 95\% CI),从而排除了分类词汇作为机制。类型化动作路由提供一致的方向增益($\text{F1} = 0.379$ vs $0.296$);控制分类词汇的保守估计为 $Δ\text{F1} = +0.075$,并且通过引导 CI ($Δ\text{F1} = +0.101$, 95\% CI $[+0.020, +0.185]$),单次基线的总体增益显着。词汇-路由分解在 GPT-4o 上复制:分类词汇相对于通用反射没有增加显着的价值 ($p = 0.773$),而操作路由提供了显着的收益 ($p = 0.025$),确认了该机制在主干网中适用。收益集中在结构新颖的冲突上:在缅甸($\text{F1}: 0.000 \rightarrow 0.353$)和乌克兰($0.167 \rightarrow 0.500$),仅词汇条件仅恢复到通用反射,而动作路由打破了退化先验。这些发现将类型化的行动路由(而不是诊断脚手架或分类词汇表)确定为元认知 LLM 预测代理的有前途的设计原则,同时激发跨冲突类型的更大规模评估。