论文
RL后训练构建组合推理策略
RL Post-Training Builds Compositional Reasoning Strategies
摘要
RL后训练是仅仅放大基座模型中已潜在的基元技能,还是能把基元技能组合成新的高层策略?我们在完全可观测的重写文法环境中研究该问题——预训练分布已知、每个生成的重写都可审计。Transformer在基元符号重写链上预训练,在仅有二元最终答案奖励的基于轨迹的推理任务上后训练。RL解决了预训练模型即便在大得多的采样预算下仍极少解决的留出问题,而拒绝微调早期改进但趋于平台。轨迹分析显示RL经分阶段组合机制重组基元能力:先强化基元归约,再发现有效的组合流程——包括折叠基元归约有序链的顺序组合,与单步组合独立基元归约的并行组合。组合流程不是孤立样本:它们被复用并巩固为稳定的技能库。RL与拒绝微调的对比显示关键差异不在探索量而在选择性:RFT产出许多类捷径的重写(多为无效),而RL把探索集中于有效可复用结构。预训练消融显示组合策略的出现不只由基元暴露门控,而由预训练是否把基元能力组织为RL后续可压缩的归约流程决定。基座模型提供弱的过程配料;RL把它们建成可靠的高层策略。
