论文
UltraX:通过自适应编程编辑大规模精炼 预训练 数据
UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing
摘要
随着可用的训练数据接近其物理极限,缩放定律带来的收益开始减少。因此,改进 大语言模型 (LLM) 现在更少地依赖于数据扩展,而更多地依赖于更高质量的数据利用率。然而,在大规模语料库的背景下,现有的细化方法在质量、效率和可靠性方面面临着重大限制:基于规则的方法受到固定启发式的限制,并且难以应对实例级的变化;基于LLM的方法提高了质量,但无法满足大规模数据处理的效率和可靠性要求。为了应对这些挑战,我们提出了UltraX,一种针对大规模预训练数据的函数调用细化框架,通过在删除和修改之外引入插入来完善编辑功能空间,从而实现细粒度的实例级编辑。具体来说,UltraX 构建了可靠的程序监督生成管道。在此管道中,数据集自适应提示优化首先引导专家 LLM 生成高质量的端到端精炼文本,然后行对齐映射和动态上下文替换将原始精炼文本对转换为结构化程序监督。同时,UltraX通过操作组合的低置信度示例过滤和比例控制采样提高了监督质量并稳定了训练分布。在推理和执行过程中,通过滑动窗口预测、全局运算聚合和系统后处理对模型输出进行归一化和验证,提高大规模执行的稳定性和可靠性。实验表明,UltraX 在所有语料库中实现了最高的平均性能,并且还以更少的训练标记匹配或超越了基线,展示了更强的数据效率和细化可靠性。