论文
通过跨模型熵的无标签强化学习
Label-Free Reinforcement Learning via Cross-Model Entropy
摘要
使用强化学习的 后训练 大语言模型 受到奖励信号的瓶颈。现有方法需要 真值 可验证的奖励,将训练限制在具有自动正确性检查的领域(例如数学、代码执行),或者需要人类偏好标签,这些标签的收集成本很高并且容易出现 奖励作弊。最近的无标签方法用自参考信号(例如模型自身输出的多数投票或词元熵)取代了 真值 验证器,但存在强化模型自身错误的风险。在这项工作中,我们提出跨模型熵(CME),即在单独的验证器模型下生成器响应的平均对数似然,作为 RL 后训练 的无标签奖励信号。 CME 是连续的,无需训练,并基于这样的原则:验证者认为不出所料的响应可能是正确的或高质量的。由于验证器独立于生成器,因此信号无法通过自洽进行博弈。我们将 CME 集成到 GRPO 中,不对训练循环进行任何其他更改,将无标签强化学习扩展到开放式指令跟踪——在这种情况下,自我参照信号不适用或不太适合。在开放式指令跟踪(UltraFeedback 提示,在 AlpacaEval 2.0 上评估)中,CME 奖励在四个模型系列(Qwen、Llama、Gemma、OLMo)和三个训练体系(预训练、SFT 和指令调整)的正面对战 LLM 作为法官比较中击败了未经训练的基础,平局调整获胜率范围从 52.5% 到 52.5% 不等。 71.4%。代码将在发布后发布。