论文
SPIRAL:学习搜索与聚合
SPIRAL: Learning to Search and Aggregate
摘要
语言模型推理可在测试时经脚手架大幅改进——把推理算力扩展到不同原语上:单条踪迹内的顺序推理、独立采样的并行踪迹——以及把多条推理踪迹聚合为最终响应。但在后训练期间——语言模型仅针对单条踪迹内的顺序推理优化。我们介绍顺序-并行-聚合强化学习(SPIRAL)——把语言模型训练为统一推理计算管线中使用全部三种原语的框架。具体地——语言模型先并行采样一组独立踪迹——每条经顺序思维链推理产生——然后以这些踪迹为条件生成最终聚合踪迹;所有组件对照最终聚合响应的奖励端到端优化。为训练该系统——SPIRAL用集合强化学习教模型产出一组对聚合器集体有用的踪迹——用标准强化学习教模型把该集合聚合为改进的最终响应。推理任务上的实验表明SPIRAL有效随推理算力扩展——当三种计算原语都被扩展时——较GRPO取得至多11倍扩展效率与15%更高性能。
