论文

G-Zero:从零数据开始的开放式生成的自我游戏

G-Zero: Self-Play for Open-Ended Generation from Zero Data

模型训练强化学习

摘要

自我进化的 LLM 在可验证领域表现出色,但在开放式任务中表现不佳,其中对代理 LLM 法官的依赖引入了能力瓶颈和 奖励作弊。为了克服这个问题,我们引入了 G-Zero,这是一种无需验证者的共同进化框架,用于自主自我改进。我们的核心创新是提示-$δ$,这是一种内在奖励,可量化生成器模型的无辅助响应与其基于自我生成提示的响应之间的预测转变。使用该信号,Proposer 模型通过 GRPO 进行训练,通过综合具有挑战性的查询和信息提示来持续瞄准生成器的盲点。生成器同时通过 DPO 进行优化,以内部化这些提示引导的改进。从理论上讲,我们证明了 G-Zero 的理想化标准 DPO 版本的最佳迭代次优保证,前提是提案者引入足够的探索覆盖范围并且数据过滤保持伪标签得分噪声较低。通过完全从内部分配动态中获得监督,G-Zero 绕过了外部法官的能力上限,为跨不可验证领域的连续 LLM 自我进化提供了可扩展、稳健的途径。