论文

RL能教会LLM长程推理吗?表达力是关键

Can RL Teach Long-Horizon Reasoning to LLMs? Expressiveness Is Key

模型训练强化学习

摘要

强化学习 (RL) 已被应用于改进大语言模型 (LLM) 推理,但由于缺乏受控、可扩展的环境,对训练如何随任务难度进行扩展的系统研究受到了阻碍。我们引入了 ScaleLogic,一个综合逻辑推理框架,它提供对两个难度轴的独立控制:所需证明规划的深度(即范围)和底层逻辑的表达能力。我们提出的框架支持广泛的逻辑:从简单的仅蕴涵逻辑(“if-then”)到更具表现力的一阶推理,包括合取(“and”)、析取(“or”)、否定(“not”)和通用量化(“for all”)。使用这个框架,我们表明强化学习训练计算$T$遵循关于推理深度$D$的幂律($T \propto D^{\gamma}$, $R^{2} > 0.99$),并且缩放指数$\gamma$随着逻辑表达力单调增加,从$1.04$到$2.60$。在下游数学和一般推理基准上,与表达能力较低的设置相比,更具表达能力的训练设置会产生更大的性能增益(高达 $+10.66$ 点)和更高的计算效率,这表明模型的训练内容(而不仅仅是训练的程度)决定了下游传输。我们进一步表明,幂律关系在多种强化学习方法中都成立,并且基于课程的培训大大提高了扩展效率。

RL能教会LLM长程推理吗?表达力是关键
图 1:ScaleLogic 概述。每个问题都有B B 个候选证明树,其中恰好有一个有可证明的结论;由于破坏了一个公理,其他公理就变得无法证明。深度D D 控制检验深度。左:仅暗示推理。右:最具表现力的逻辑设置(在第 3.2 节中称为 + 量化)结合了合取、析取、否定和全称量化。