论文
LLM自我修正何时有帮助?控制理论马尔可夫诊断和验证优先干预
When Does LLM Self-Correction Help? A Control-Theoretic Markov Diagnostic and Verify-First Intervention
摘要
迭代自我修正广泛应用于代理大语言模型系统中,但反复改进何时有益还是有害仍不清楚。我们将自我校正构建为控制论反馈循环,其中相同的语言模型既充当控制器又充当被控对象,并使用基于{正确、不正确}的二态马尔可夫模型来操作简单的部署诊断:仅在 ECR/EIR > Acc/(1 - Acc) 时进行迭代。从这个角度来看,EIR 起到稳定裕度的作用,并起到轻量级控制器设计的提示作用。在 7 个模型和 3 个数据集(GSM8K、MATH、StrategyQA)中,我们发现一个尖锐的接近于零的 EIR 阈值 (<= 0.5%),将有益与有害的自我校正分开。仅 o3-mini (+3.4 pp, EIR = 0%)、Claude Opus 4.6 (+0.6 pp, EIR ~ 0.2%) 和 o4-mini (+/-0 pp) 保持非降级; GPT-5 降级为 -1.8 pp。验证优先提示消融提供了因果证据,表明该阈值可通过单独提示进行操作:在 GPT-4o-mini 上,它将 EIR 从 2% 降低至 0%,并将 -6.2 pp 降级变为 +0.2 pp(配对 McNemar p < 10^-4),同时对已经低于阈值的模型产生很小的变化。 ASC 进一步说明了停止权衡:它停止了有害的改进,但会产生 3.8 个百分点的置信成本。总体而言,该论文认为,自我纠正不应被视为默认行为,而应被视为由可测量的误差动态控制的控制决策。
