论文

EvoSelect:针对目标任务适应的数据高效 LLM 演进

EvoSelect: Data-Efficient LLM Evolution for Targeted Task Adaptation

模型训练合成数据

摘要

高效且有效地使 大语言模型 (LLM) 适应目标任务仍然是一项基本挑战。这种适应通常需要针对目标任务迭代改进模型,但收集高质量的人工标记数据来支持这一过程成本高昂且难以扩展。因此,合成数据生成已成为一种灵活且可扩展的替代方案。一种简单的方法是通过迭代生成训练循环,其中通过外部生成器合成候选数据,使用这些数据更新模型,并通过迭代重复该过程。然而,生成的样本可能有噪声、高度冗余,甚至与目标任务分布不一致。对此类数据不加区别地进行训练会削弱有用的学习信号,甚至降低模型性能。为了解决这个问题,我们引入了一种改进的范例,即迭代生成-选择-训练循环,其中包含模型更新之前的选择步骤。在此范例的基础上,我们提出了 EvoSelect,这是一个数据高效的框架,可以有效地发展 LLM。给定数据生成器生成的候选样本,EvoSelect 通过联合建模目标任务对齐和多样性来选择训练数据。我们通过代理梯度表示的最佳传输来估计任务相关性,这量化了候选样本与目标任务分布的对齐程度。为了减少冗余,我们采用了多样化机制,以促进补充训练样本的覆盖范围。通过交错对齐和多样化,EvoSelect 能够实现 LLM 向目标任务的逐步演进。对各种基准的大量实验表明,无论是弱数据生成器还是强数据生成器,EvoSelect 都能持续提高现有数据选择方法的适应效率。