论文
通过任务-能力协同进化发现新型LLM专家
Discovering Novel LLM Experts via Task-Capability Coevolution
摘要
前沿模型开发者希望持续训练模型,使其具备涌现的、多样的能力。为扩展能力,当前的预训练与后训练范式每次都需要手动使用静态数据集或奖励函数启动训练运行。针对这一局限,我们的工作追求这样一个洞见:开放性(通过模型与任务的协同进化)能够在单次运行中发现具有日益新颖技能的模型。我们提出一个新的模型开发框架,将协同进化扩展到大语言模型(LLM)发现,即开放式的评估与多样能力协同进化(Assessment Coevolving with Diverse Capabilities, AC/DC)。AC/DC通过模型合并进化LLM,同时通过合成数据生成进化自然语言任务。AC/DC发现不断增长的LLM档案库,这些模型能超越更大LLM的能力,同时占用更少的GPU显存。特别地,我们的LLM种群在下游基准上比其他精选模型或基线获得更广的专业能力覆盖(Coverage),且完全没有进行任何显式的基准优化。此外,AC/DC随时间提升Coverage,在任务与模型上持续创新,并提升多智能体best-of-N选择的性能。我们的发现凸显了协同进化作为从基础LLM中挖掘更广泛能力集合的手段的潜力。总体而言,AC/DC使我们离一种全新的LLM开发范式更近一步:通过把现有模型当作通向更强大模型的垫脚石,加速模型能力多样性的持续改进。
