论文

CNM-BERT:通过表意描述序列进行汉字的直接结构嵌入

CNM-BERT: A Drop-In Structural Embedding for Chinese Characters via Ideographic Description Sequences

模型架构混合架构

摘要

像 BERT 这样基于 token 的编码器将汉字视为原子标识符,忽略它们的递归正字法结构。因此,模型依赖于上下文共现,从而降低了罕见字符和词汇外 (OOV) 字符的性能。我们提出了组合网络模型(CNM),这是一种轻量级增强,可将离散组合结构注入 Transformer 编码器中。 CNM 将表意描述序列 (IDS) 解析为树,通过递归 Tree-MLP 对它们进行编码,并将结构嵌入融合到 BERT 中,而无需修改主干。对 Wu 等人进行了评估。 (2025) 结构探测基准,CNM-BERT 在长尾和 OOV 字符上的表现优于最强基线 (ChineseBERT),结构精度为 +9.8,激进 F1 为 +7.7。此外,CNM-BERT 在基础和大规模的 CLUE、MRC 和 NER 任务中都取得了一致的收益,这表明显式结构注入可以提供强大的 OOV 理解和有形的下游价值。