论文

Parason:揭示LLM推理中的子任务并行与尝试并行

Parason: Revealing Subtask and Trial Parallelism in LLM Reasoning

模型推理模型训练强化学习批处理与并行RLVR

摘要

扩展测试时推理已大幅提升大语言模型(LLM)的问题解决能力,但标准的自回归解码仍按顺序执行长推理轨迹,给困难任务带来严重延迟(可达数天乃至数周)。并行推理提供了一种自然的补救方法。然而,先前的系统主要关注子任务并行(Subtask Parallelism),即模型学会把高层任务分解成可独立求解的小块。这一思路忽视了另一种普遍存在的并行形式:尝试并行(Trial Parallelism),即多个推测性尝试并行地探索、验证并聚合相互竞争的假设。本文提出Parason,揭示并学习LLM推理中的这两种并行形式。我们的分析发现,尝试并行占可并行推理计算的大多数(在HLE中占DeepSeek-V4推理步骤的65.5%),并且它在困难问题上愈发占主导。在这一分类法的指导下,Parason用无上下文文法将顺序推理轨迹转换为结构化并行轨迹,然后用并行感知的组相对策略优化(PA-GRPO)训练模型,其奖励共同平衡准确率、延迟与两种并行比例。在推理时,Parason通过工具调用执行学到的并行结构,把理论上的节省转化为真实世界的挂钟时间加速。在包括AIME24与AIME25的数学推理基准上的实验表明,Parason在保持有竞争力的准确率的同时实现平均约1.7倍的加速。

Parason:揭示LLM推理中的子任务并行与尝试并行:论文配图
图1:两类并行化的概览。图中对比了子任务并行化(最终答案需要所有分解分支)与试验并行化(将多条不确定路径作为备选(OR)分支探索)。尽管存在这种OR关系,所有Trial分支的输出都被拼接进后续上下文,使每个分支的内容都可用于最终综合。先前工作主要关注子任务并行化,而我们的分析表明,在我们研究的每个模型上,试验并行化占HLE上可并行化推理的大多数,且DeepSeek-R1与DeepSeek-V4在两个数据集上均超过58%。