论文
粤语适应语言模型能否更好地预测粤语阅读?跨模型眼动追踪评估
Do Cantonese-Adapted Language Models Better Predict Cantonese Reading? A Cross-Model Eye-Tracking Evaluation
摘要
来自自回归语言模型的信息论测量被广泛用于描述塑造人类阅读的期望,但特定于语言种类的训练是否可以改善这种心理语言学一致性仍不清楚。对于粤语来说,这个问题仍然悬而未决,最近的 NLP 评估报告称,相对于普通话或通用模型,针对粤语的训练所带来的好处参差不齐。使用自然粤语眼动追踪数据,我们比较了两个家庭内适应对比:CKIP GPT-2 Tiny 与其轻微粤语适应的 JED351 衍生品,以及 Qwen2.5-7B 与 CantoneseLLM-7B,后者经历了更广泛的粤语持续预训练和指令调整。从每个模型中,我们推导出词汇意外、词性意外、目标之前的熵和熵减少。词汇惊喜和联合四度量模型一致支持 CantoneseLLM-7B,其次是 Qwen2.5-7B、CKIP 和 JED351,而熵减少则支持 CKIP。这些结果表明,更广泛的粤语特定训练可能与更强的预测拟合相关,而模型排名也取决于正在评估的信息论测量。