论文
Inspicio:开放词汇、基于 LLM 的历史语言语义检索
Inspicio: Open-Vocabulary, LLM-Based Sense Retrieval for Historical Languages
摘要
英语和少数资源丰富的现代语言的词义消歧技术进展迅速,但它仍然假设源语言中存在词义库存和词义映射(Navigli,2026)。对于大多数历史悠久且资源匮乏的语言来说,这些假设不成立,这些语言的专用 WordNet 要么不完整,要么仍在建设中。我们提出了 Inspicio,一种开放词汇检索管道,可将上下文中的标记链接到开放英语 WordNet(McCrae 等人,2020)的同义词集,而无需任何源语言库存或映射。对于每次出现,指令调整的 LLM 都会生成周围句子的两个英语翻译、一小组候选字典式定义和一些候选英语引理。这些输出驱动混合检索步骤,该步骤结合了密集定义-同义词集相似性、稀疏引理匹配和最大边际相关性重新排序。我们评估了 LLM 的 6x6 网格和句子嵌入模型的管道,包括一组新的手动注释的拉丁语和古希腊语感知动词双语集、PREMOVE 数据集的子集(Farina,2025)以及意大利语的历时样本。最佳配置在感知动词测试集上达到 96% Recall@50,每个组件都贡献可测量的收益,并且在域外和跨语言设置中保持竞争力。