论文

广撒网:代码推理的协调 Pass@K 策略优化

Cast a Wider Net: Coordinated Pass@K Policy Optimization for Code Reasoning

模型推理推理搜索与路径规划

摘要

使用验证器重复采样是为代码生成分配测试时间计算的标准方法,以 pass@$K$ 作为规范指标。然而,标准策略类从单个答案分布中抽取 $K$ 独立样本,因此尝试经常会崩溃到近乎重复的推理路径上,并在冗余轨迹采样上浪费预算。这种失败在竞争性编程中代价高昂,因为许多问题都承认多种不同的算法策略,并且通过@$K$只需要一次正确的尝试。我们提出协调 Pass@$K$ 策略优化(CPPO),它将 pass@$K$ 生成转变为对策略的联合探索:规划器发出 $K{=}4$ 替代高级方法的元组,共享求解器尝试每种方法一个解决方案。 CPPO 使用乘法规划器奖励 $R_{\mathrm{plan}} = J_ψ\cdot R_{\mathrm{out}}$ 来训练此联合策略,仅将信用分配给导致验证者确认通过@$K$ 成功的有效策略元组。在 APPS、CodeContests 和 LiveCodeBench-v6 中,在相同的 $K{=}4$ 求解器尝试预算下,CPPO 相对于直接采样、规划基线、仅规划器 SFT 和 pass@$K$ 导向的 RL 改进了 pass@$4$,并且在九个模型基准单元中的六个上取得了统计上显着的增益。 Qwen3.5-9B LiveCodeBench-v6 上最大的单一增益为 $+0.16$,超过最强基线 PKPO($0.588 \rightarrow 0.748$;配对引导程序,$p < 0.05$)。