论文

ORACLE:通过约束引导的合成数据激发优化大语言模型的推理能力

ORACLE: Optimizing Reasoning Abilities of Large Language Models via Constraint-Led Synthetic Data Elicitation

模型训练合成数据

摘要

使用合成推理数据训练大语言模型(LLM)已成为提升其推理能力的流行方法,而影响该范式有效性的关键因素是所生成多步推理数据的质量。为了生成高质量推理数据,许多近期方法生成合成推理路径并依据最终答案正确性进行筛选,往往忽视了中间推理步骤中的缺陷。为加强对中间推理步骤的验证,先前工作主要诉诸代码执行或符号推理引擎。然而,基于代码的验证局限于代码或数学任务,而推理引擎需要结构良好且完整的上下文。因此,现有方法在涉及模糊或不完整上下文的自然语言推理任务中无法有效发挥作用。在此类任务中,合成数据仍缺乏用于验证每个推理步骤的可靠检验。为应对这一挑战,我们提出ORACLE,一个受三段论推理启发的结构化数据生成框架。ORACLE将LLM的生成优势与符号监督相结合:LLM产出逐步推理上下文,而符号推理引擎验证每个中间步骤的有效性。通过采用统一提示模板引出模块化推理链,ORACLE实现了细粒度的步骤级验证,有助于构建高质量多步推理数据。在六个逻辑、事实与常识推理基准上,ORACLE在多个模型上均持续优于强基线。

ORACLE:通过约束引导的合成数据激发优化大语言模型的推理能力:论文配图
图 1:我们的 ORACLE 两阶段训练流程概述。 ORACLE采用两阶段训练流程:第一阶段采用少样本提示和基于模板的推理生成,然后是基于答案和基于格式的过滤;第 2 阶段通过集束搜索集成符号推理,为监督微调 (SFT) 和直接偏好优化 (DPO) 生成高质量的推理数据。