论文
从推理跟踪到可重用模块:理解语言模型推理中的组合概括
From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning
摘要
将监督式 微调 (SFT) 与强化学习 (RL) 相结合的 后训练 管道已成为将 大语言模型 (LLM) 转变为稳健推理器的关键秘诀。我们认为,这种综合成功是由组合泛化驱动的,我们通过分层潜在选择模型将其形式化。在这个框架中,推理轨迹是由与可重用原子模块相对应的一系列离散潜在选择变量生成的,包括技能(本地操作)和路由机制(如何选择、重用和组合中间信息)。在这个模型中,我们从理论上证明 SFT 和 RL 发挥着不对称、互补的作用:SFT 在成分痕迹中提供原始模块材料,而 RL 分解这些痕迹以识别潜在的原子模块并实现成分泛化。我们设计了对照实验来验证这一理论。我们的结果表明,强化学习可以从 SFT 提供的复合轨迹中提取原子模块,并将它们重新组合以解决新的配置问题。此外,我们发现对复合迹线的训练比对孤立原子模块的训练具有更强的泛化能力。最后,我们研究了 SFT 和 RL 数据之间的关系,并确定了一种有效的协议,其中 SFT 通过成分跟踪确保覆盖所有原子模块,而 RL 则专注于 SFT 支持之外的新颖成分以推动探索。