论文

Logics-STEM:通过失败驱动的后训练与文档知识增强赋能LLM推理

Logics-STEM: Empowering LLM Reasoning via Failure-Driven Post-Training and Document Knowledge Enhancement

模型训练合成数据

摘要

我们提出Logics-STEM,一个在Logics-STEM-SFT-Dataset上微调的最先进推理模型;该数据集是千万(10M)规模的高质量、多样化数据集,是规模最大的开源长思维链语料之一。Logics-STEM面向科学、技术、工程与数学(STEM)领域的推理任务,在STEM相关基准上表现卓越,在8B规模上较次优模型平均提升4.68%。我们将这些收益归因于我们的数据-算法协同设计引擎,数据与算法被联合优化以拟合推理背后的黄金标准分布。数据方面,Logics-STEM-SFT-Dataset由精心设计的数据整理引擎构建,该引擎包含标注、去重、去污染、蒸馏与分层采样5个阶段,以保证质量、多样性与可扩展性。算法方面,我们的失败驱动后训练框架在监督微调(SFT)阶段利用围绕模型失败区域的针对性知识检索与数据合成,有效引导第二阶段SFT或强化学习(RL),以更好地拟合目标分布。Logics-STEM的卓越实证表现揭示了将大规模开源数据与精心设计的合成数据相结合的巨大潜力,凸显了数据-算法协同设计在通过后训练增强推理能力方面的关键作用。我们公开了Logics-STEM模型(8B与32B)以及Logics-STEM-SFT-Dataset(10M与下采样的2.2M版本),以支持开源社区的未来研究。

Logics-STEM:通过失败驱动的后训练与文档知识增强赋能LLM推理 配图
图 2:Long CoT 数据引擎概览