论文
Parason:揭示LLM推理中的子任务并行与尝试并行
Parason: Revealing Subtask and Trial Parallelism in LLM Reasoning
摘要
扩展测试时推理已大幅提升大语言模型(LLM)的问题解决能力,但标准的自回归解码仍按顺序执行长推理轨迹,给困难任务带来严重延迟(可达数天乃至数周)。并行推理提供了一种自然的补救方法。然而,先前的系统主要关注子任务并行(Subtask Parallelism),即模型学会把高层任务分解成可独立求解的小块。这一思路忽视了另一种普遍存在的并行形式:尝试并行(Trial Parallelism),即多个推测性尝试并行地探索、验证并聚合相互竞争的假设。本文提出Parason,揭示并学习LLM推理中的这两种并行形式。我们的分析发现,尝试并行占可并行推理计算的大多数(在HLE中占DeepSeek-V4推理步骤的65.5%),并且它在困难问题上愈发占主导。在这一分类法的指导下,Parason用无上下文文法将顺序推理轨迹转换为结构化并行轨迹,然后用并行感知的组相对策略优化(PA-GRPO)训练模型,其奖励共同平衡准确率、延迟与两种并行比例。在推理时,Parason通过工具调用执行学到的并行结构,把理论上的节省转化为真实世界的挂钟时间加速。在包括AIME24与AIME25的数学推理基准上的实验表明,Parason在保持有竞争力的准确率的同时实现平均约1.7倍的加速。
