论文

防止模型崩溃:Fisher-Rao 视角下的综合数据训练动态

Preventing Model Collapse: A Fisher-Rao Perspective on the Dynamics of Training with Synthetic Data

模型评测模型行为与机制分析

摘要

大型语言模型(LLM)现在通常使用合成数据进行训练,因为高质量的人类数据已经被越来越大的模型不断增长的需求所耗尽。然而,对合成数据的递归训练经常会导致模型崩溃,这是一种退化反馈循环,模型会逐渐忘记真正的底层数据分布。对合成数据和新鲜人类数据的混合进行训练是一种合乎逻辑的对策,可以防止模型崩溃。然而,维持训练稳定性所需的人类数据与合成数据的最小确切比率是多少,仍然是一个悬而未决的问题。在本文中,我们对防止模型崩溃所需的最低人类数据率建立了严格的理论保证。尽管以前的工作为此比率建立了正式的下界,但对于非常高的维度,这种下界可能是空的,因为分析依赖于 R^n 中通常的欧几里德度量,并且不适应分类概率分布的空间。相反,在本文中,我们通过分析 Fisher-Rao 度量下的过程动力学来明确利用概率单纯形的信息几何结构。我们推导出稳定的定量收缩和不变性界限,并且不会随着维度的增加而变得微不足道。因此,我们表明防止模型崩溃所需的有效数据比率与之前暗示的不同。