论文
结构提示承载线索:预训练语料中的标记、边界与表达格式
The Announcement Carries the Cue: Markup, Boundaries, and the Notation of Pre-Training Corpora
摘要
文档的排列方式(即其符号)是一个没有数据集卡记录的训练变量。该领域已经确定文本提取选择会改变模型行为,并且从未测量过这些选择放入语料库中的符号。我们定义了干净窗口生存,即对有多少流仍然需要边界推断的确定性计数,并在三个方面进行测量符号。语料库包含什么:对 13 个公共语料库进行的普查,其中视觉转换的 PDF 切片中的生存率降至 0.153,而 C4 中的生存率降至 0.889;稀缺资源不是无标记文本,而是长无标记文本;预先注册的供应测试发现什么仍然是机构而非消费者。我们自己的预先注册的预测失败了:转换器不会在散文上制造结构,而这迫使其赖以生存的可靠性机制。读者使用的内容:跨越 0.6B 到 8.2B 的五个基本模型和两条管道,删除结构性声明会使接下来的散文更难预测,而交换其符号则不会产生任何影响。这个零并不会让符号变得不重要;它重新定位了变量:操作提示是公告,而不是印记。作者强加的:有界零值。基本模型不会将标记的寄存器强加于创作的基线之上,并且在删除每一个公告的情况下提交散文,他们不会将其放回,其速度与零与创作的参考零没有区别。我们提供这些测量所暗示的格式:纯框架、按编写顺序排列的段落、删除到可逆 sidecar 中的每个公告、与公告存在而不是符号上的标记副本混合。根据他们训练的能力而不是他们保留的保真度来选择格式操作员,并在数据卡上记录提取器的身份和生存情况。