论文

OPERA:通过基于客观困惑的强化学习来调整开放式推理

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

模型训练强化学习

摘要

强化学习 (RL) 使 LLM 在数学和代码生成等客观推理任务中表现出色。然而,将强化学习应用于开放式任务(例如创意写作)仍然具有挑战性,因为 LLM 作为法官的奖励模型经常表现出风格偏差和位置不一致,导致监督不稳定。为了解决这个问题,我们提出了 OPERA(基于客观困惑的反射对齐),它用从困惑动态中获得的内在奖励取代了不可靠的外部判断。具体来说,我们从困惑动态中得出内在奖励信号,量化关键反射状态下的不确定性减少。在冷启动阶段,我们引入了一种数据合成方法,该方法利用精心设计的引导词来生成不同的推理轨迹,以及利用内部对数概率来识别逻辑一致的推理分支的优先按困惑度采样的轨迹。该管道生成包含 20,000 个高质量推理轨迹的大规模数据集。实证评估一致证明了我们的方法对于开放式任务的可扩展性和有效性。在 Qwen3-8B 上实施 OPERA 在开源模型中建立了新的最先进水平,在一些开放式任务中达到或超过 Gemini2.5 和 MiniMax-M2.5 等专有模型。代码可在 https://github.com/pangpang-xuan/OPERA 获取。