论文

LLM 数学推理的危害感知事后替换的防护修复

Guarded Repair for Harm-Aware Post-hoc Replacement of LLM Mathematical Reasoning

模型推理推理验证与自校正

摘要

LLM 数学推理的事后修复引入了不对称风险:修复不正确的推理跟踪是有用的,但替换已经正确的跟踪可能是有害的。我们在选择性替换设置下研究这个问题,其中系统必须决定修复的候选是否比保留原始缓存的跟踪更安全。我们提出了 GuardedRepair,这是一种受保护的 best-of-N 修复框架,它可以诊断缓存的推理痕迹,有选择地触发修复,并且仅在确定性验证防护支持替换时才接受答案更改候选者。该框架结合了轻量级符号检查、表面语义风险诊断、有界候选生成和保守的接受策略。在完整的 GSM8K 测试集上,初始推理器已达到 95.60% 的准确率,GuardedRepair 将最终准确率提高至 96.89%,修复了 58 个剩余错误中的 17 个,而在主运行中没有测量到错误的正确情况。在弱推理 ASDiv 设置上,准确率从 78.40% 提高到 87.60%。直接再生基线表明,这种增益不能仅通过更强的模型重新求解来解释:重新求解所有 GSM8K 示例将准确性降低至 93.03%,并打破了 47 个最初的正确答案。其他分析表明,防护修复极大地改善了固定/损坏的权衡,同时还表明更换风险降低而不是消除。这些结果支持将事后修复视为有危害意识的选择性替换,而不是不受约束的重新解决。