论文

RL后训练构建组合推理策略

RL Post-Training Builds Compositional Reasoning Strategies

模型训练强化学习

摘要

RL后训练是仅仅放大基座模型中已潜在的基元技能,还是能把基元技能组合成新的高层策略?我们在完全可观测的重写文法环境中研究该问题——预训练分布已知、每个生成的重写都可审计。Transformer在基元符号重写链上预训练,在仅有二元最终答案奖励的基于轨迹的推理任务上后训练。RL解决了预训练模型即便在大得多的采样预算下仍极少解决的留出问题,而拒绝微调早期改进但趋于平台。轨迹分析显示RL经分阶段组合机制重组基元能力:先强化基元归约,再发现有效的组合流程——包括折叠基元归约有序链的顺序组合,与单步组合独立基元归约的并行组合。组合流程不是孤立样本:它们被复用并巩固为稳定的技能库。RL与拒绝微调的对比显示关键差异不在探索量而在选择性:RFT产出许多类捷径的重写(多为无效),而RL把探索集中于有效可复用结构。预训练消融显示组合策略的出现不只由基元暴露门控,而由预训练是否把基元能力组织为RL后续可压缩的归约流程决定。基座模型提供弱的过程配料;RL把它们建成可靠的高层策略。

RL后训练构建组合推理策略:论文配图
图 1:受控环境和培训流程。 (a) 每个源字符映射到一个或多个全局唯一的右侧字符串。 (b) 预训练数据由多步骤序列组成,其中一个步骤的输出成为下一步的输入。 (c) 每个训练三元组编码单个原始扩展或收缩。 (d) RL 提示是通过从目标符号重复向前扩展来构造的。 (e) 难度级别由超出模型 256 个词元生成预算的最佳收缩步骤数来定义。