论文

迈向AGI的数据科学与技术第一部分:分级数据管理

Data Science and Technology Towards AGI Part I: Tiered Data Management

模型训练合成数据

摘要

人工智能的发展可视为数据驱动学习范式的演化,数据组织与利用方式的相继转变不断推动模型能力进步。当前LLM研究由高度依赖数据规模单向扩展的范式主导,日益遭遇数据可得性、获取成本与训练效率方面的瓶颈。在这项工作中,我们论证AGI的发展正在进入数据-模型协同进化的新阶段:模型主动引导数据管理,而高质量数据反过来放大模型能力。为落实这一愿景,我们提出一个分级数据管理框架,旨在跨异构学习目标与成本约束支持LLM训练的完整生命周期。具体而言,我们引入L0-L4分级数据管理框架,范围涵盖从原始未整理资源到经过组织、可验证的知识。重要的是,LLM被充分用于数据管理过程(如质量评分与内容编辑),以跨层级精炼数据。每个层级具有独特的数据性质、管理策略与训练角色,使数据能够在预训练、中期训练与对齐等LLM训练阶段之间进行战略性分配。该框架在数据质量、获取成本与边际训练收益之间取得平衡,为可扩展、可持续的数据管理提供了系统化方法。我们通过实证研究验证所提框架的有效性:从原始语料构建分级数据集,并将其用于多个训练阶段。实验结果表明,层级感知的数据利用显著提升了训练效率与模型性能。为促进后续研究,我们向社区发布我们的分级数据集与处理工具。

迈向AGI的数据科学与技术第一部分:分级数据管理
图2:分级数据管理框架。该框架通过定义五个不同的阶段,建立了以数据质量与可信度为核心的细粒度标准。框架借助专用算子逐步提升数据纯度,同时管理从原始数据到高密度知识资产的演进过程及其相关计算成本。