论文
大型文学语料库的自动主题索引:伏尔泰全集的机器学习方法
Automatic Thematic Indexing of Large Literary Corpora: A Machine Learning Approach to Voltaire's Complete Works
摘要
主题索引——为文本部分分配结构化概念标签的做法——对于大规模文学和历史版本的学术访问至关重要,但它仍然是一个很大程度上是手动、劳动密集型的过程。本文探讨了机器学习在自动主题索引中的应用,使用《伏尔泰全集》的两个重要子语料库作为测试用例:《Essai sur les mœurs et l'esprit des Nations》和《Questions sur l'Encyclopédie》。该任务被定义为多标签分类问题,其中模型必须分配专业索引器将应用于给定文本页面的索引条目集。我们比较了一系列方法——从带有分类头的基于编码器的模型到通过低秩适应 (LoRA) 微调的生成式 大语言模型 (LLM)——涵盖的模型大小从大约 3 到 1200 亿个参数。我们性能最佳的模型来自 Mistral 系列,采用 4 位量化配置,F1 分数高达 0.67;我们认为,考虑到专业索引固有的主观性以及模型预测在语义上证明有效的频率,尽管与印刷索引有所不同,这些数字代表了下限。我们进一步评估跨语料库泛化,并对源文本的文学和修辞特征的模型行为进行详细的定性分析,这些特征被证明特别抵制自动化处理。我们的研究结果对提供大规模文学和历史语料库的结构化主题访问这一更广泛的挑战具有影响。