论文
CyberCorrect:用于大语言模型闭环自我纠正的控制论框架
CyberCorrect: A Cybernetic Framework for Closed-Loop Self-Correction in Large Language Models
摘要
大语言模型(LLM)自我纠正——检测并修复生成输出中错误的能力——在很大程度上仍是临时性的,依赖“请重新考虑你的答案”这类通用提示,缺乏系统的错误分析或收敛保证。我们提出CyberCorrect,一个以控制论为基础、将LLM自我纠正形式化为闭环控制系统的框架。该框架将LLM生成器建模为被控对象,并引入三模态错误检测器(结合自洽性、言语化置信度和逻辑链验证)作为传感器。类型导向的纠正控制器基于诊断出的错误类别生成针对性修复指令,而收敛判定器使用改编自控制理论的稳定性准则确定迭代终止。我们进一步引入三个控制论评估指标——收敛率、过冲率和振荡率——以捕捉最终准确率之外的纠正动力学。在我们构建的CyberCorrect-Bench(440个带错误类型与纠正路径标注的推理任务)上的实验表明,CyberCorrect达到79.8%的最终准确率,比现有最佳自我纠正方法提升6.2个百分点,并通过其收敛控制机制将过冲(错误的过度纠正)降低41%。