论文
范围:通过开放式任务的共同进化策略进行自我博弈
SCOPE: Self-Play via Co-Evolving Policies for Open-Ended Tasks
摘要
自对弈可以在没有外部监督的情况下训练语言模型。然而,现有的方法需要规则可检查的答案,使得开放式任务依赖于策划的提示或前沿模型法官。我们引入了 SCOPE,这是一个用于开放式任务的无数据自我对弈框架,它共同演化了两种策略:生成基于文档的任务的挑战者,以及通过多轮检索回答这些任务的求解器。初始模型的冻结副本充当自我判断,它从源文档中编写特定于任务的规则,并根据它们对求解器的响应进行评分。在三个 7-8B 指令调整模型(Qwen2.5、Qwen3、OLMo-3)中,SCOPE 在八个基准测试中将开放式性能提高了 10.4 分,并且匹配或超过了在约 9K 精选提示上训练的 GRPO_data。尽管仅针对开放式任务进行训练,但 SCOPE 还在 7 个 Hold-out 基准测试中将 Hold-out 简短形式 QA 提高了高达 +13.8 分,在所有三个模型上都超过了 GRPO_data。消融表明,共同进化挑战者对于保持任务接近求解器的前沿是必要的,收益来自检索和合成的改进,相对贡献因任务而异,并且标题生成质量是自我判断的瓶颈。