论文

基于集群的平衡采样和数据并行分配以实现高性能微调

Clustering-Based Balanced Sampling and Allocation with Data Parallelism for High-Performance Fine-Tuning

模型训练合成数据

摘要

大型语言模型 (LLM) 的指令调优数据集通常很大、冗余且不平衡,限制了有效的适应。朴素的大批量微调反复包含代表性过高的样本组,同时较弱地覆盖代表性不足但信息丰富的样本组,特别是在跨多个 GPU 的数据并行 (DP) 下。我们提出了 CluSTER,一种集群感知的平衡采样框架,用于在 DP 指令调优中训练高效数据缩减。 CluSTER通过梯度空间聚类和DP感知平衡分配来策划代表性的缩减数据集,确保跨集群和工作人员的双层覆盖,同时通过加权更新保留原始数据分布。因此,CluSTER 在不影响模型质量的情况下减少了冗余计算并提高了训练稳定性。在多个指令调优数据集中,与之前的采样和数据缩减方法相比,CluSTER 将训练时间减少了高达 69.6%,并且几乎没有准确性损失。代码可在 https://github.com/kaist-dmlab/CluSTER 获取。