论文

DIVE:通过多样性驱动的技能进化解锁冻结语言模型中的自我完善

DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution

摘要

如果没有参数更新,大语言模型 (LLM) 无法保留部署后的体验。我们引入了 DIVE,这是一个多样性驱动的框架,它使冻结的 LLM 通过从任务经验和验证者反馈中发展持久的自然语言技能来改进。这些技能编码可重用的推理过程、验证策略、常见故障模式和输出约束,并且都由相同的底层模型执行和修改,无需访问教师模型。由于自然语言技能演化是一个随机的、非凸的搜索过程,因此优化单个技能轨迹可能会过度拟合采样经验或收敛到次优解决方案。 DIVE 通过从引导经验中独立发展多个技能群体、通过不同的转换自适应地改进它们以及联合选择一组互补的技能来减轻这种优化差异。在六个数学和逻辑推理任务以及多个模型系列中,DIVE 始终优于现有推理方法、提示优化方法、技能开发框架和基于记忆的基线。它通过积累的经验实现快速自我改进,与 SFT 和 GRPO 等基于参数的方法相比,以更少的执行轨迹次数获得更大的性能提升,并通过 GEPA 进行快速优化。此外,由此产生的技能可以跨模型规模和系列进行转移,使得 GPT-5-nano 等较小模型在传统提示下能够匹配或优于较大模型(即 GPT-5)。这些结果将多样性驱动的技能进化确立为一种有效的、可解释的、无参数的 LLM 自我提升方法。