论文
通过质量感知分词为基座模型预训练解锁带噪声的真实世界语料
Unlocking Noisy Real-World Corpora for Foundation Model Pre-Training via Quality-Aware Tokenization
摘要
当前的分词方法在处理序列数据时不考虑信号质量,限制了其在带噪声的真实世界语料上的效果。我们提出 QA-Token(Quality-Aware Tokenization,质量感知分词),它将数据可靠性直接纳入词表构建。我们有三大关键贡献:(i)一个联合优化词表构建与下游性能的双层优化表述;(ii)一种通过质量感知奖励学习合并策略并具有收敛保证的强化学习方法;(iii)一个经由 Gumbel-Softmax 松弛实现端到端优化的自适应参数学习机制。实验评估显示了一致的改进:基因组学领域,变异检测 F1 较 BPE 提升 6.7 个百分点;金融领域,夏普比率提升 30%。在基座规模上,我们对包含 1.7 万亿碱基对的预训练语料进行分词,取得最先进的病原体检测成绩(94.53 MCC),同时将 token 数量减少 15%。我们在零推理开销的情况下,为基座模型训练解锁了横跨 PB 级基因组序列与 TB 级金融时间序列的带噪声真实世界语料。