论文

OpenDeepThink:基于Bradley-Terry聚合的并行推理

OpenDeepThink: Parallel Reasoning via Bradley--Terry Aggregation

模型推理推理搜索与路径规划

摘要

测试时计算扩展是提升大语言模型(LLM)推理能力的主要途径之一。现有方法主要通过延长单条推理轨迹来扩展深度。通过并行采样多个候选来扩展广度虽然直接,却引入了选择瓶颈:在缺乏真值验证器的情况下选出最佳候选,因为逐点式LLM评判噪声大且有偏差。为解决这一问题,我们提出OpenDeepThink,一种通过成对Bradley-Terry比较进行选择的基于种群的测试时计算框架。在每一代中,LLM对随机的候选对进行评判,并通过Bradley-Terry将投票聚合为全局排名;排名靠前的候选被保留,前四分之三的候选利用比较过程中产生的自然语言评论进行变异,最末四分之一被丢弃。OpenDeepThink在八轮顺序LLM调用(约27分钟实际耗时)内将Gemini 3.1 Pro的有效Codeforces Elo提升+405分。该流程无需重新调参即可迁移到更弱或更强的模型上;在多领域HLE基准上,增益集中在可客观验证的领域,而在主观领域则出现反转。我们发布了CF-73,一个由73道经专家评分的Codeforces题目组成的精选集,附带国际特级大师(International Grandmaster)标注,且本地评估与官方判定的一致率达99%。