论文
历史意大利语对于语言模型来说有多令人惊讶?代币化税、综合税和简单的缓解措施
How Surprising Is Historical Italian to Language Models? Tokenization Tax, Comprehension Tax, and a Simple Mitigation
摘要
大语言模型 (LLM) 对于数字图书馆工作流程越来越重要,但人们对它们处理历史语言的能力仍然知之甚少。历史难度通常被视为一个整体障碍,将拼写变化、语言距离和训练前暴露混为一谈。在本文中,我们提出了一个诊断框架,将这一困难分解为四个不同的维度:标记化成本、预测不确定性(意外)、语义鲁棒性和上下文敏感性。我们在跨越三个世纪的三个数据集上评估这个框架:(1)从原始页面图像数字化的新策划的 17 世纪意大利文本(1610-1689)语料库; (2) 经典的 19 世纪意大利“I Promessi Sposi”作为高曝光控制; (3) 18 世纪俄罗斯民间印刷书籍作为对比正字法压力测试。我们的结果揭示了编码成本和理解之间的明显分离。虽然俄罗斯和早期现代意大利遭受了类似的代币化惩罚(通货膨胀 25-30%),但它们的预测难度却截然不同。 17 世纪的意大利语比现代意大利语平均令人惊讶程度高出 2.4 倍,其中学术散文达到 3.2 倍,而俄语仅略有增加。但预测不确定性并不意味着代表性退化:在所有数据集中嵌入相似性仍然保持稳健(> 0.85),这证实了即使生成不稳定,模型也可以代表历史意义。最后,我们证明了最小的时间上下文提示可以将历史意外情况减少大约 60%,从而提供了一种简单的、与模型无关的缓解措施。这些发现表明,虽然历史文本施加了一致的编码税,但数字图书馆可以安全地部署 LLM 来执行语义检索任务,只要仔细调整生成应用程序即可。