论文

自进化语言模型推理中的泛化差距

On the Generalization Gap in Self-Evolving Language Model Reasoning

模型训练合成数据

摘要

最近的工作表明,大语言模型 (LLM) 可以使用模型本身生成的监督信号通过自我进化 (SE) 进行改进。在这项工作中,我们问:在严格的闭环设置下,自进化算法只能访问未标记的提示集和基本模型,内部生成的监督与预言机监督训练有多接近?我们在统一的离线自我进化框架中分析了四种代表性策略:单轮验证、带反馈的多轮修正、迭代训练和课程学习。我们的主要实验使用 Knights and Knaves (KK) 逻辑推理任务,该任务提供确定性解决方案、受控难度级别以及用于从易到难泛化的干净测试台。我们首先表明,自我进化比基本模型持续改进,但在投入过多的训练计算后会出现停滞,最终仍然给预言机监督留下了不小的差距。我们发现大型模型的多轮批评修正可以达到很强的自进化性能,Gemma 12B 几乎与预言机监督训练相匹配。除了 Knights 和 Knaves 之外,我们还根据现实世界的推理基准来评估自我进化,其中的收益也很有限。总的来说,我们的结果描述了闭环自我进化何时可以提供帮助,并表明在这种最小的公式下内部生成的监督仍然不足。