论文

LLM自我修正何时有帮助?控制理论马尔可夫诊断和验证优先干预

When Does LLM Self-Correction Help? A Control-Theoretic Markov Diagnostic and Verify-First Intervention

模型推理推理验证与自校正

摘要

迭代自我修正广泛应用于代理大语言模型系统中,但反复改进何时有益还是有害仍不清楚。我们将自我校正构建为控制论反馈循环,其中相同的语言模型既充当控制器又充当被控对象,并使用基于{正确、不正确}的二态马尔可夫模型来操作简单的部署诊断:仅在 ECR/EIR > Acc/(1 - Acc) 时进行迭代。从这个角度来看,EIR 起到稳定裕度的作用,并起到轻量级控制器设计的提示作用。在 7 个模型和 3 个数据集(GSM8K、MATH、StrategyQA)中,我们发现一个尖锐的接近于零的 EIR 阈值 (<= 0.5%),将有益与有害的自我校正分开。仅 o3-mini (+3.4 pp, EIR = 0%)、Claude Opus 4.6 (+0.6 pp, EIR ~ 0.2%) 和 o4-mini (+/-0 pp) 保持非降级; GPT-5 降级为 -1.8 pp。验证优先提示消融提供了因果证据,表明该阈值可通过单独提示进行操作:在 GPT-4o-mini 上,它将 EIR 从 2% 降低至 0%,并将 -6.2 pp 降级变为 +0.2 pp(配对 McNemar p < 10^-4),同时对已经低于阈值的模型产生很小的变化。 ASC 进一步说明了停止权衡:它停止了有害的改进,但会产生 3.8 个百分点的置信成本。总体而言,该论文认为,自我纠正不应被视为默认行为,而应被视为由可测量的误差动态控制的控制决策。

LLM自我修正何时有帮助?控制理论马尔可夫诊断和验证优先干预
图 1:作为马尔可夫反馈循环的迭代自校正的三层视图。理论层通过 EIR/ECR 转换将 { C , I } \{C,I\} 上的正确性演化形式化,产生平衡、稳态和收敛表达式。控制层将EIR解释为稳定裕度,将验证优先提示解释为控制器设计; ASC 添加了实例级置信度 γ ⁡ ( k ) ≥ τ \gamma(k)\!\geq\!\tau 以及批处理级 EIR ^ / ECR ^ \widehat{\text{EIR}}/\widehat{\text{ECR}} 监控以实现早期停止。经验层评估 7 个模型 × \times 3 数据集,确认接近零的 EIR ( ≲ 0.5 % \lesssim 0.5\% ) 作为区分有益与有害自我校正的阈值。