论文
EvoLen:DNA 语言模型的进化引导标记化
EvoLen: Evolution-Guided Tokenization for DNA Language Model
摘要
词元是 DNA 语言模型 (DNALM) 中表示的基本单位,但其设计仍未得到充分探索。与自然语言不同,DNA 缺乏固有的标记边界或预定义的组成规则,这使得标记化成为一种基本的建模决策,而不是自然指定的决策。虽然字节对编码 (BPE) 等现有方法擅长捕获反映人类生成的语言规律的标记结构,但 DNA 是根据生物功能和进化约束而不是语言惯例来组织的。我们认为 DNA 标记化应该优先考虑功能序列模式,例如调控基序——在进化限制下的短的、重复出现的片段,并且通常在物种间保存。我们通过 EvoLen 将进化信息直接纳入标记化过程,EvoLen 是一种将进化分层与长度感知解码相结合的标记化器,以更好地保留基序规模的功能序列单元。 EvoLen 使用跨物种进化信号对 DNA 序列进行分组,在每个组上训练单独的 BPE 分词器,通过优先保留模式的规则合并生成的词汇表,并通过动态编程应用长度感知解码。通过受控实验,EvoLen 改善了功能序列模式的保存、跨基因组环境的差异以及与进化约束的对齐,同时在不同的 DNALM 基准上匹配或优于标准 BPE。这些结果表明,标记化引入了关键的归纳偏差,并且结合进化信息产生了更具生物学意义和可解释的序列表示。代码、预训练和微调的检查点以及分词器文件可在 https://github.com/HN020719/EvoLen 和 https://huggingface.co/EvoLenTokenizer 上获取。