论文
基于影响力的代码大语言模型预训练数据选择实证研究
An Empirical Study on Influence-Based Pretraining Data Selection for Code Large Language Models
摘要
代码 大语言模型(代码-LLM)的最新进展展示了解决编程相关任务的卓越能力。同时,研究人员已经认识到,预训练 数据的质量对于提高 LLM 性能至关重要。然而,现有的预训练数据过滤研究大多集中在通用数据集上,而很少关注编程数据集。在本文中,我们的目标是通过在编程相关数据集的背景下探索广泛使用的通用数据过滤技术(即数据影响力得分过滤)的有效性来解决这一差距。为此,我们首先介绍一种计算生成编程任务的数据影响力得分的方法,该方法涉及将各种下游编码任务转换为验证集,并使用这些集上的模型损失作为性能指标。接下来,我们在 1000 亿个代码标记的数据集上从头开始预训练具有 10 亿个参数的 Code-LLM。在此基础上,我们进行了广泛的实证研究来评估数据影响力得分过滤方法的有效性。具体来说,我们检查该技术如何改善模型性能,研究有益训练数据的特征在不同训练阶段和编程任务中如何变化,并评估基于预测的数据影响分数过滤方法的可行性。我们的研究结果表明,基于验证集损失的数据影响分数过滤可以提高模型编程性能。此外,我们观察到,有益训练数据的标准在各种下游编程任务中存在显着差异。