论文

CRAFT:用于训练数据自适应过滤的聚类回归

CRAFT: Clustered Regression for Adaptive Filtering of Training data

模型训练合成数据

摘要

随着语料库增长到数千万个数据点,从大型语料库中为 微调 选择一个小型、高质量的子集变得越来越重要,这使得完整的 微调 变得昂贵且通常没有必要。我们提出了 CRAFT(训练数据自适应过滤的聚类回归),这是一种用于训练序列到序列模型的向量化不可知选择方法。 CRAFT 分解联合源-目标分布并执行两阶段选择:(i)通过 k 均值集群之间的比例预算分配来匹配验证源分布,以及(ii)在每个源集群内,选择其目标嵌入最小化从验证目标分布得出的条件预期距离的训练对。我们证明,比例簇分配限制了选定分布和验证分布之间的连续 KL 散度,而残差由簇直径控制。我们通过 LoRA 从 3300 万个 NLLB 句子对和 微调 mBART 中选择训练数据来评估英语-印地语翻译的 CRAFT。 CRAFT 在相同的候选池和编码器上实现了 43.34 BLEU,比 TSDS (41.21) 高出 2.13 个点,同时完成选择的速度快了 40 倍以上。通过 TF-IDF 矢量化,整个管道在 CPU 上在一分钟内完成。 TAROT 达到 45.61 BLEU,但 CRAFT 在 26.86 秒内完成选择,而 TAROT 为 75.6 秒,加速了 2.8 倍。