论文
发布的LLM词汇能否支持词元级隐藏语料库的估计?
Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?
摘要
预训练语料库的组成塑造了 LLM 的能力,但即使模型权重被释放,它通常仍然是隐藏的。之前的工作已经推断了语料库混合物或从已发布的分词器词汇表中追踪特定的分词组;相反,我们估计任意目标标记的语料库比率。我们首先表明,在不同语料库上训练的 BPE 分词器共享稳定的词元 ID 比率分布,从而激励从已知语料库到在隐藏语料库上训练的目标分词器的分布转移。然后,我们提出分位数引导密度估计 (QGDE),它用多个分位数趋势来近似该分布,并使用局部密度加权来生成 词元级 估计。在受控设置和使用已发布的 SmolLM 分词器的实际设置中,QGDE 的 词元级 估计平均相对误差低至 3.00%,聚合成类别级混合后平均相对误差低至 3.08%。这些结果表明,发布的分词器词汇为粗粒度成分推断之外的细粒度语料库估计提供了有用的信号。