论文

技能自我对战:通过共同进化的技能推动 LLM 能力的前沿

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skills

模型训练强化学习

摘要

LLM训练正在从手动设计和注释转向交互驱动的自我进化。然而,现有的自进化方法在任务多样性和验证可靠性之间面临着根本性的困境:受环境限制的方法获得精确的反馈,但将学习限制在狭窄的领域,而开放式的自生成扩大了任务空间,但缺乏可靠的验证,导致误导性奖励污染训练循环。我们将代理技能视为调和这种紧张关系的强大中间立场:每种技能都确保在特定场景中深入、可验证的执行,而跨技能的动态路由则保持开放式任务的多样性。利用这一见解,我们引入了技能自我对弈(Skill-SP),这是一个由提议者、求解器和动态技能控制器组成的共同进化框架。通过强化学习循环进行编排,这些组件在连续的自我游戏循环中共同进化:提议者根据动态采样的技能生成具有挑战性的任务;求解器探索候选解决方案以突破其能力边界;技能控制器收集执行反馈来更新和扩展技能库。这种交互式共同进化有效地弥合了结构化验证和开放式探索之间的差距。对工具使用和推理基准的实证评估表明,Skill-SP 作为强大的进化引擎,持续推动有能力的骨干网的性能上限,同时促进最初错位模型的惊人转变。我们的代码可在 https://github.com/Qwen-Applications/skill-self-play 获取。