论文
伪词探针:语言模型与人类词汇敏感性的差异
Pseudowords as probes: Large Language Models show little of the sublexical sensitivity that governs human pseudoword processing
摘要
系统性,即形式到意义的概率映射,渗透到语言的各个层面,而词汇下的线索已被证明可以控制人类的伪词处理。然而,LLM 是否对这些线索表现出类似的敏感性仍不清楚。我们在两个意大利两种选择强制选择伪词实验中测试了 5 个 LLM,并将它们的反应与人类行为基线进行了比较。当真实单词选项提供词汇熟悉度提示时,LLM 与人类的一致性比在仅伪单词条件下更可靠,在仅伪单词条件下,LLM 的性能大大低于 fastText(一种字符 n-gram 模型)。此外,可靠地驱动人类-fastText一致性的词下余弦相似性线索并没有一致地转移到人类-LLM对齐,并且推理-token支出与人类处理难度没有一致的关系。这些发现表明,LLM 不一定共享控制人类伪词处理的词汇下线索;我们讨论标记化和训练数据覆盖率作为候选解释。