论文
Group Pattern Selection Optimization:让LRM为推理选对模式
Group Pattern Selection Optimization: Let LRMs Pick the Right Pattern for Reasoning
摘要
大型推理模型(LRM)表现出多样的高层推理模式(如直接求解、反思与验证、探索多个解),但主流训练配方隐性地把模型偏向有限的几种主导模式。通过系统分析,我们发现这些模式在数学与科学基准上存在显著的准确率差异,揭示模型的默认推理模式对给定问题往往并非最优。为此,我们提出Group Pattern Selection Optimization(GPSO),一个扩展GRPO的强化学习框架,它引入多模式rollout、由验证器指导的逐问题最优模式选择,以及优化期间用注意力掩码防止显式模式后缀泄漏进学习到的策略。通过探索多样化的推理策略组合并在最有效的策略上优化,GPSO使模型内化从问题特征到最优推理模式的映射。大量实验表明,GPSO在各种模型骨干与基准上带来一致且显著的性能提升,有效缓解模式次优问题,促成更稳健、更具适应性的推理。全部数据与代码发布于 https://github.com/wanghanbinpanda/GPSO。
