SUPERNOVA:以自然指令上的强化学习引出LLM的通用推理
SUPERNOVA: Eliciting General Reasoning in LLMs with Reinforcement Learning on Natural Instructions
摘要
具有可验证奖励的强化学习 (RLVR) 显着改进了数学和代码等正式领域中的大语言模型 (LLM) 推理。尽管取得了这些进步,大语言模型仍然难以完成需要因果推理和时间理解等能力的一般推理任务。将 RLVR 扩展到一般推理从根本上说是由于缺乏涵盖不同推理技能的高质量、可验证的训练数据而受到限制。为了应对这一挑战,我们提出了 SUPERNOVA,这是一种 RLVR 数据管理框架,旨在增强一般推理能力。我们的主要见解是,包含专家注释的事实真相的指令调整数据集编码丰富的推理模式,可以系统地适应 RLVR。为了研究这一点,我们进行了 100 多个受控 RL 实验,以分析数据设计选择如何影响下游推理性能。特别是,我们研究了三个关键因素:(i)源任务选择,(ii)任务混合策略,以及(iii)提高数据质量的综合干预措施。我们的分析表明,源任务选择并不简单,并且对下游推理性能有重大影响。此外,根据单个目标任务的表现来选择任务优于基于整体平均表现的策略。最后,在 SUPERNOVA 上训练的模型在具有挑战性的推理基准(包括 BBEH、Zebralogic 和 MMLU-Pro)上优于强基线(例如 Qwen3.5)。特别是,SUPERNOVA 上的训练在不同模型大小的 BBEH 上产生了高达 52.8% 的相对改进,证明了 RLVR 原则性数据管理的有效性。我们的研究结果为管理人工注释资源以将 RLVR 扩展到一般推理提供了实用的见解。代码和数据可在 https://github.com/asuvarna31/supernova 获取。
