论文

HARP:用于微调的高效数据选择 大语言模型

HARP: Efficient Data Selection for Finetuning Large Language Models

模型训练合成数据

摘要

微调数据选择需要平衡两个相互竞争的目标:选择改进下游目标的示例,并且这样做不需要反复微调模型。免训练选择器是可扩展的,但依赖于嵌入相似性或聚类等代理,这可能与目标不匹配。基于训练的选择器通过梯度信号、子集评估或 Shapley 归因更好地反映下游效用,但需要许多昂贵的训练-评估迭代。我们提出了分层活动区域修剪(HARP),这是一种基于训练的高效选择器,可以保留下游对齐,同时降低选择成本。 HARP 将训练池组织成节点-叶子层次结构,仅评估代表性叶子,并使用经验贝叶斯后验推断未测量的效用。然后,它使用两个互补的信封来选择数据:HARP-C(保守地控制冗余)和 HARP-E(附加奖励互补区域)。我们从理论上证明,在局部平滑和有界估计误差下,HARP 可以控制选择误差,同时降低训练-评估成本。我们进一步验证 HARP 变体可实现最佳结果,并且比最强基线高出 $+8.9$ 点,同时使用大约 $7\times$ 的训练示例。