论文

Poly-EPO:训练探索性推理模型

Poly-EPO: Training Exploratory Reasoning Models

模型训练强化学习Agentic RL

摘要

探索是从经验中学习的基石:它使智能体能够找到复杂问题的解、泛化到新问题,并随测试时计算扩展性能。本文提出一个用于语言模型(LM)后训练的框架,它显式鼓励乐观探索并促进探索与利用之间的协同。核心思想是训练LM生成这样的回答集合:它们在奖励函数下整体准确,且在推理策略上具有探索性。我们首先发展出在任意目标函数下用集合强化学习(set RL)优化LM的通用配方,展示如何通过对优势计算的修改将标准RL算法适配到这一设定。随后我们提出Polychromic Exploratory Policy Optimization(Poly-EPO),以一个显式协同探索与利用的目标将该框架实例化。在一系列推理基准上,我们表明Poly-EPO提升了泛化能力(更高的pass@$k$覆盖率),保持了模型生成中更大的多样性,并能有效随测试时计算扩展。

Poly-EPO:训练探索性推理模型:论文配图
图 1:测试集上的 Pass@kk 评估。 x 轴是评估中使用的尝试 kk 的次数,而 y 轴是测试集的覆盖范围。这里使用的基本模型是 Qwen3-4B-Base,Poly-EPO 和 GRPO+DIV 用于聚类响应的 LM 判断是 Qwen-3-4B-Instruct。