论文

通过 预训练 文本上基于 Rubric 的自玩引导开放式任务的 后训练 信号

Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text

模型训练强化学习

摘要

自我对战最近已成为 后训练 大语言模型 (LLM) 的一个有前途的范例。在自我游戏中,目标 LLM 创建任务输入(例如问题),然后通过生成任务输出(例如答案)来解决自身问题。奖励模型评估输出,奖励通常通过强化学习 (RL) 用于训练 LLM。 后训练 LLM 自我对弈的一个主要好处是其最小的监督成本:自我对弈避免了传统上由人类构建的高质量输入输出对或昂贵的专有模型的需要。然而,现有的工作仅针对可验证的任务(例如数学和编码)探索自我对弈,对于这些任务,目标 真值 可用且易于检查。在本文中,我们寻求将自我游戏扩展到更现实的开放式任务。我们提出了 POP,一个自我对弈框架,它使用相同的 LLM 来合成评估规则以及每个输入输出对。该标题用于评估输出和训练模型。至关重要的是,我们将框架建立在内容丰富的预训练语料库上,以(1)实现可利用的生成验证差距并减少 奖励作弊,以及(2)防止模式崩溃。在 Qwen-2.5-7B 上,POP 提高了预训练基础模型和指令调整模型在从长篇医疗保健 QA 到创意写作和指令遵循等多项任务上的性能。