论文

SPIRAL:学习搜索与聚合

SPIRAL: Learning to Search and Aggregate

模型训练强化学习RLVR

摘要

语言模型推理可在测试时经脚手架大幅改进——把推理算力扩展到不同原语上:单条踪迹内的顺序推理、独立采样的并行踪迹——以及把多条推理踪迹聚合为最终响应。但在后训练期间——语言模型仅针对单条踪迹内的顺序推理优化。我们介绍顺序-并行-聚合强化学习(SPIRAL)——把语言模型训练为统一推理计算管线中使用全部三种原语的框架。具体地——语言模型先并行采样一组独立踪迹——每条经顺序思维链推理产生——然后以这些踪迹为条件生成最终聚合踪迹;所有组件对照最终聚合响应的奖励端到端优化。为训练该系统——SPIRAL用集合强化学习教模型产出一组对聚合器集体有用的踪迹——用标准强化学习教模型把该集合聚合为改进的最终响应。推理任务上的实验表明SPIRAL有效随推理算力扩展——当三种计算原语都被扩展时——较GRPO取得至多11倍扩展效率与15%更高性能。

SPIRAL:学习搜索与聚合:论文配图
图 1:螺旋概述。上图:Spiral 训练语言模型 (LM) 以使用顺序、并行和聚合端到端推理计算。给定输入 xx,我们独立采样 nn 个并行推理轨迹。然后 LM 将这些合成为最终的聚合轨迹 y*y_{*}。仅使用最终奖励 r⁡(x,y*)r(x,y_{*}),Spiral 通过集合 RL 优化并行生成,并通过标准 RL 优化聚合跟踪。因此,该模型共同学习生成有用聚合的痕迹并有效地合成它们。底部:当我们在测试时缩放所有三个基元时,螺旋缩放明显优于 GRPO,特别是在混合这些基元(例如递归自聚合)的混合策略下。