论文

为 大语言模型 注入双向逻辑以实现稳健的链条修复

Imbuing Large Language Models with Bidirectional Logic for Robust Chain Repair

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 中的自回归思想链 (CoT) 推理基本上是前向的:每个步骤仅以先前的标记为条件。这种单向归纳偏差甚至使有能力的模型也容易受到错误滚雪球的影响,其中早期步骤中的单个逻辑或算术错误会不可逆转地破坏整个推理链。我们引入了目的推理填充(\TRI{}),这是一种训练框架,赋予仅解码器的 Transformer 原生 \emph{目标条件桥接} 功能。关键的见解是将错误的推理部分重新构建为中间填充(FIM)任务:给定经过验证的前缀前提 $P$、经过验证的下游里程碑 $S$ 和原始查询 $Q$,模型必须综合严格且完整地连接 $P$ 和 $S$ 的逻辑桥 $M$。为了通过标准因果架构实现这一目标,我们引入了具有三个不重叠哨兵标记的前缀-后缀-中间(PSM)序列重排,使$M$能够同时关注$P$和$S$,而无需对自注意力机制进行任何结构修改。训练分两个阶段进行:(i) 对从正式数学语料库中提取的经过符号验证的 $(P, S, M)$ 三元组进行监督 微调 (SFT),以及 (ii) 使用确定性符号验证器(Lean 4 / Python)作为唯一奖励预言机进行直接偏好优化 (DPO),消除 LLM 法官的阿谀奉承。由此推断,TRI 在双系统循环中作为外科修复模块运行:因果草图模型生成初始轨迹,验证器查明故障,TRI 仅填充损坏的部分,使已验证的部分保持完整。对三个基准的综合实验表明,TRI 在所有任务中都实现了最先进的性能,同时将每个问题的词元支出减少了 31.2%。