论文

Morpheus:土耳其语的形态感知神经分词器和词嵌入器

Morpheus: A Morphology-Aware Neural Tokenizer and Word Embedder for Turkish

模型架构新型架构

摘要

土耳其语是粘着性的:意义是由语素承载的,然而驱动现代语言模型的子词分词器通过语料库统计来分割单词,分割语义加载的后缀——在 WordPiece 和基于规则的分析器的情况下——无法将其输出解码回原始文本。本文提出了 \textbf{Morpheus},一种土耳其语神经语素边界模型,它既是一个无损的、形态感知的分词器,又是一个词嵌入生成器。可微的泊松二项式动态程序在训练期间将每个字符的边界概率转换为软语素成员资格,在推理时将其转换为精确片段,没有字符串归一化,因此 $\mathrm{decode}(\mathrm{encode}(w)) = w$ 通过构造成立。由于该模型是神经模型,因此标记化的同一前向传递也会发出结构化词嵌入。在可逆分词器中(唯一对生成有效的分词器),Morpheus 获得了最低的每个字符位数($1.425$),大约使子字系列的金标准形态对齐增加了一倍(MorphScore 宏 F1 $0.61$ vs.\ ${\sim}0.32$),并且使用的 GPU 内存比 64K 词汇子字分词器少 ${\sim}19\%$。作为嵌入器,冻结的 Morpheus 向量在词法检索(根族 MAP $0.85$)和同根验证(ROC-AUC $1.00$)方面领先,超过了多语言 检索器 BGE-M3 和 BERTurk;在上下文和词形变化相关的任务(NER、大小写/数字探测)上,较重的上下文编码器仍然领先——我们将这种权衡归因于 Morpheus 以根为中心的几何结构。代码:https://github.com/lonewolf-rd/TurkishMorpheus;型号:https://huggingface.co/lonewolflab/Morpheus-TR-50K;交互式演示:https://huggingface.co/spaces/lonewolflab/morpheus-tr-demo。