AI 词元值多少钱?野生人工智能生成的网络文本的缩放法则
How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text
摘要
网络文本构成了预训练数据的大部分,并且越来越多地由人工智能生成。应用 FineWeb 质量过滤后,我们发现 2026 年 6 月网络数据中有 27.5% 的 token 被标记为由 Pangram 生成的 AI,到 8 月这一比例上升至 31.1%。与合成数据或模型崩溃设置不同,这种“狂野”人工智能文本来自许多模型,是为人类读者编写的,并且在预训练语料库中未加标签。野外人工智能文本如何影响语言模型预训练?为了回答这个问题,我们预训练了 800 个语言模型,改变添加的 AI 标记与人类标记的比率,并根据人类和 AI 生成的文本的保留损失拟合缩放法则。对于数据匮乏的模型,在预训练数据中添加人工智能词元最初会降低人类文本的损失,但随着添加更多的词元,好处会饱和,并很快“逆转”成危害。对于接受高预算人类文本训练的模型,人工智能词元几乎立即增加损失,而相同数量的新鲜人类词元则不断降低损失。霍夫曼等人的缩放定律。 (2022)未能预测这种行为。我们提出了一种新的缩放法则,具有单独的利益和损害条款,允许 AI 词元的价值改变符号,同时在没有 AI 文本的情况下减少到 Chinchilla。当适用于较小的模型时,我们的缩放定律可以预测 AI 文本对模型大小高达 3.6 倍的保留人类文本损失的影响,并且与所有 AI 比率的现有最佳定律相比,误差降低了 41%。我们建议当目标是人类文本时过滤人工智能文本,在使用人工智能生成的网络文本扩展训练数据集之前重复人类文本,并分别报告人类和人工智能文本的验证损失当目标是人工智能文本时人工智能文本仍然有价值。我们在 https://github.com/pangramlabs/WildAI. 发布了 WildAI,这是一个带有 AI、主题和格式标签的 83B 词元语料库,所有 800 个模型和代码