论文

SPREG:面向大语言模型推理的熵引导测试时干预结构化计划修复

SPREG: Structured Plan Repair with Entropy-Guided Test-Time Intervention for Large Language Model Reasoning

模型推理推理验证与自校正

摘要

大语言模型(LLM)在长链推理中容易出现逻辑幻觉与随机漂移。尽管无分类器引导(CFG)能够提升指令遵循度,但标准的静态实现常导致语义稀释与语言质量退化。我们提出 SPREG(Structured Plan-guided Real-time Entropy Gating,结构化计划引导的实时熵门控),一个面向精准纠错的轻量级推理时框架。SPREG 采用自适应双阈值机制监控实时熵,将突发的“熵尖峰”识别为逻辑失败的可靠信号。一旦检测到,它便通过用由历史高置信状态合成的参考分布替换无信息的零先验来触发动态修复。通过根据结构化推理阶段(如 Action、Observation)调节引导强度,SPREG 在不损害流畅性的前提下将模型拉回稳定流形。我们的实验展示了显著收益,尤其是 AIME25 上 20.0% 的绝对准确率提升,同时有效抑制了复杂任务中不受控的熵漂移。

SPREG:面向大语言模型推理的熵引导测试时干预结构化计划修复:论文配图
图 2:SPREG 框架的整体执行管道。 SPREG 充当轻量级推理时间包装器,旨在增强 LLM 推理的可靠性。 (下)PlanTracker 将生成划分为逻辑段(例如,操作、观察)。 (中)对于每个解码步骤 tt,系统并行观察基本 LLM 输出以计算香农熵 HtH_{t} 并维护滑动窗口 𝒲\mathcal{W} 来计算自适应阈值 {μ𝒲,σ𝒲}\{\mu_{\mathcal{W}},\sigma_{\mathcal{W}}\}。如果检测到异常 (Ht>τH_{t}>\tau),则激活自适应 CFG 修复以调节 logits。这确保了精确的令牌级干预,有效纠正意外上下文引起的错误(例如“输出错误”)。