论文

HERMES:预训练 数据混合物的多粒度标签基底

HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures

模型训练预训练

摘要

大多数数据混合方法假设语料库已经被划分成组,并且这些组的选择决定了混合器可以表达的内容。现有标签,包括出处、主题或格式分类法以及平面嵌入集群,以一种粒度致力于一个语义轴;更改分辨率会重建标签。我们认为瓶颈是标签系统,而不是混合器,并提供了一个分层系统。 HERMES 是一种数据衍生的标记基质:学习语义转换后进行 3 阶段残差矢量量化,将每个文档一次注释为从粗到细的代码,其前缀长度控制高达约 130k 单元的粒度。在粗粒度上,HERMES 在标准聚类指标上与 KMeans 系列方法处于一个平台期,因此贡献的是基底,而不是聚类器。在 1B 参数、25B 词元 预训练 上,层次结构暴露了一种固定粒度管道无法测试的交互:在一个前缀长度下,组合的第 2 阶段规则对比、等子桶覆盖率与大小成比例的桶内质量 top-30%,将 16 任务能力宏观平均值提升了 +0.0253;在下一个更精细的级别,随着候选池收缩约 5 倍,相同的规则失去了可测量的优势。 HERMES 重新构建了数据混合设计,从固定标签集的选择到导航可重用、数据派生的粒度层次结构。