论文
LM 惊异度汉语阅读预测能力的系统分析
A Systematic Analysis of the Predictive Power of LM Surprisal in Reading Chinese
摘要
本研究分析了 LM 衍生的token级别惊异度对普通话阅读时间的预测能力。我们首先提出最短匹配序列(SMS),这是一种在眼动追踪语料库假定的分词和 LM 的子词分词之间进行映射的对齐方案,因为这两种分词在普通话的上下文中通常不一致。然后,使用一套用 30B token进行训练的 Chinese-Pythia 模型 (14M-1.4B),我们检查了惊异度在普通话的三个段落级眼动追踪语料库(GECO-CN、HKP 和 MECO)中预测首次注视持续时间、凝视持续时间和总阅读时间的效果。与之前的无效结果相反,我们的结果表明惊异度可以预测中文阅读时间。然而,预测能力是否随模型大小和训练的数量缩放是语料库特有的:在 GECO-CN 中,较大的模型预测效果更好,而在 HKP 中出现了逆缩放,并且在 MECO 中出现了最大尺寸。随后,我们测试了 HKP 中逆缩放的一种可能解释,发现检查点的惊异度仍然更接近 $n$-gram 统计数据,是更好的阅读预测器。总而言之,惊异度对中文阅读时间测量的预测能力是语料库特有的,这警告不要从单个语料库得出缩放结论。
