论文
具有协调推理路径的计划测试时间扩展
Planned Test-Time Scaling with Coordinated Reasoning Paths
摘要
并行分支的测试时间扩展被广泛采用,以提高具有挑战性的推理任务的性能。主要方法是重复采样,独立于单个策略绘制分支,这可能会产生冗余尝试,从而限制额外推理计算的收益。为了解决这个限制,我们提出了计划测试时间缩放(PTTS),它用协调的联合策略取代独立采样:规划器为每个分支生成解决方案大纲,引导分支走向不同的推理路径,而执行器则根据每个大纲生成完整的解决方案。形式上,我们表明 PTTS 严格概括了重复采样,并且在程式化设置中,可证明促进了互补推理模式的覆盖并产生更好的 pass@k 缩放。我们在强推理模型之上实例化 PTTS,将它们固定为执行器,同时用 PTTS 推理代替重复采样,以进一步增强测试时间扩展。具体来说,我们开发了两种变体:PTTS-ZS 提示模型在单个自回归通道中联合生成所有分支的轮廓,而 PTTS-RL 使用截断的执行部署直接针对 pass@k 奖励优化规划器,以实现高效训练和更清晰的奖励信号。在 Qwen3-1.7B 和 4B 的五个数学推理基准测试中,PTTS-ZS 比重复采样将 pass@64 提高了 6.7 点,而 PTTS-RL 进一步将增益提高到 13.4 点。进一步的分析表明,更广泛地覆盖不同的推理路径有助于取得这些成果。总体而言,PTTS 提供了一个通用框架,通过协调推理分支来改进测试时间扩展,并提供零样本和可训练的实例化,从而产生显着的性能提升。