论文
Poly-EPO:训练探索性推理模型
Poly-EPO: Training Exploratory Reasoning Models
摘要
探索是从经验中学习的基石:它使智能体能够找到复杂问题的解、泛化到新问题,并随测试时计算扩展性能。本文提出一个用于语言模型(LM)后训练的框架,它显式鼓励乐观探索并促进探索与利用之间的协同。核心思想是训练LM生成这样的回答集合:它们在奖励函数下整体准确,且在推理策略上具有探索性。我们首先发展出在任意目标函数下用集合强化学习(set RL)优化LM的通用配方,展示如何通过对优势计算的修改将标准RL算法适配到这一设定。随后我们提出Polychromic Exploratory Policy Optimization(Poly-EPO),以一个显式协同探索与利用的目标将该框架实例化。在一系列推理基准上,我们表明Poly-EPO提升了泛化能力(更高的pass@$k$覆盖率),保持了模型生成中更大的多样性,并能有效随测试时计算扩展。
