开源项目

Qwen开源skill-self-play:技能自博弈的协同进化训练闭环

Qwen-Applications/skill-self-play

模型训练强化学习

概述

skill-self-play是Qwen-Applications开源的训练框架:实现可复现的技能路由、自博弈任务生成和求解器训练闭环——技能与任务协同进化,用不断生成的新任务推动模型能力边界,附arXiv论文。仓库(仓库创建日,非功能发布日)。研究自博弈(self-play)提升LLM能力边界的研究团队可复用其闭环流程;自博弈生成的任务质量参差,训练收益与算力成本需按目标能力评估。