论文
追溯根源:揭示后训练LLM数据谱系的多智能体框架
Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs
摘要
后训练数据在塑造大语言模型(LLM)能力方面起着关键作用,但数据集常被当作孤立的产物,忽视了其演化背后的系统性关联。为理清这些复杂关系,我们将数据谱系(data lineage)概念引入LLM生态,并提出一个自动化多智能体框架来重建数据集发展的演化图谱。通过大规模谱系分析,我们刻画了领域特定的结构模式,如数学导向数据集中的垂直精炼和通用领域语料中的水平聚合。此外,我们揭示了普遍存在的系统性问题,包括由数据集隐性交集引发的结构冗余,以及基准污染沿谱系路径的传播。为展示谱系分析对数据构建的实用价值,我们利用重建的谱系图创建了一个谱系感知、面向多样性的数据集。通过将指令采样锚定在上游根源头,该方法缓解了下游同质化和隐藏冗余,得到了更多样的后训练语料。我们进一步强调,以谱系为中心的分析是样本级数据集对比之外一种高效且稳健的拓扑替代方案,适用于大规模数据生态。通过将数据构建扎根于显式的谱系结构,我们的工作推动后训练数据治理迈向更系统、更可控的范式。
