论文

无需模型:文本熵率过滤减轻迭代微调崩溃

No Model Required: Text Entropy Rate Filtering Mitigates Iterative Fine-Tuning Collapse

模型训练合成数据

摘要

对合成数据的迭代微调会导致 model collapse:随着稀有模式逐渐丢失,输出多样性变窄,这是最明显的短语级重复特征。现有的缓解措施要么需要模型对数概率、外部预言机,要么需要持续访问真实的人类数据。在这里,我们开发了一种基于数学信息论的新方法:非参数 Kontoyiannis 熵率估计器 $h_k$,完全通过匹配长度统计从原始文本计算得出,没有任何类型的模型。我们证明,这实际上是在完全合成的单谱系微调设置中针对文本多样性指标的 superior 训练数据过滤器。在 Llama-3.1-8B 上的六代 QLoRA 崩溃实验中,基于 logprob 的过滤(最成熟的模型访问要求基线)在任何指标 ($p > 0.23$) 上都没有提供显着的文本多样性优势,而 $h_k$ 过滤产生 $+42\%$ 独特的三元组、$+30\%$ 词汇和$-19\%$ 重复(全部 $p < 0.001$)。我们将 $h_k$ 验证为跨域熵Agent($β= 0.924$、$R^2 = 0.746$)和崩溃检测器($ρ= +0.454$、$p < 0.0001$),跨 4 个域、2 个温度、2 个生成器-评分器模型对和 1{,}520 个生成的文档。我们的结果表明,缓解崩溃的信息论方法是有效的,并提出了维持多主体多样性的新方法。