论文

了解大型推理模型中并行采样和顺序采样之间的性能差距

Understanding Performance Gap Between Parallel and Sequential Sampling in Large Reasoning Models

模型评测模型行为与机制分析

摘要

大型推理模型 (LRM) 在数学和编码等挑战性问题上表现出了卓越的性能。然而,为了获得高质量的解决方案,可能需要多次采样。原则上,有两种采样策略可以组合起来形成更复杂的过程:顺序采样和并行采样。在本文中,我们首先严格比较这两种方法,并观察到,与之前的工作一致,并行采样似乎优于顺序采样,尽管后者应该具有更多的表示能力。为了理解下面的原因,我们对这种行为背后的原因做出三个假设:(i)由于聚合器运算符,并行采样表现优于; (ii) 顺序采样因需要使用较长的上下文而受到损害; (iii) 由于以先前的答案为条件,连续采样导致探索减少。各种模型系列和规模(Qwen3、DeepSeek-R1 蒸馏模型、Gemini 2.5)和问题领域(数学和编码)的经验证据表明,聚合和上下文长度似乎并不是性能差距背后的主要原因。相比之下,缺乏探索似乎发挥了相当大的作用,我们认为这是造成性能差距的主要原因之一。