论文
PACUTE:菲律宾语对符号的音韵、词缀和字符级别的理解
PACUTE: Phonology-, Affix-, and Character-level Understanding of Tokens for Filipino
摘要
大语言模型 (LLM) 将文本处理为子词标记序列,这可能会掩盖单词形成背后的字符级和形态结构。对于具有非连接形态的语言来说,这种限制最为严重,其中标准标记器系统地使标记边界与语素边界错位。我们推出了 PACUTE,这是一个包含 4,600 项任务的诊断基准,旨在评估菲律宾语的形态理解,菲律宾语的特点是富有成效的固定、重复和变音符号驱动的词汇区别,而书面文本中通常不存在这些区别。 PACUTE 包括一个由六个成分级别组成的分层诊断框架,可定位形态学理解失败的位置。评估开放权重 LLM 和前沿商业模型,我们发现开放权重模型在词素分解上几乎有机会执行,无论规模如何。前沿模型的表现要好得多,通常可以在包含匹配评分下恢复单个词缀,但在词素转换和音节化的组合任务上仍然远远低于其字符级上限。这些结果表明,高效的形态构成(而不是单独的字符访问)是菲律宾语单词结构理解的持续瓶颈。