论文
ChemCLIR-Bench:多语言化学专利中跨语言信息检索的基准测试
ChemCLIR-Bench: Benchmarking Cross-Lingual Information Retrieval in Multilingual Chemical Patents
摘要
跨语言信息检索 (CLIR) 在跨国行业中变得越来越重要,其中关键技术证据可能以与查询不同的语言存在。然而,现有的基准测试并不能充分捕获特定领域的跨语言检索或聚合召回隐藏的检索深度和可恢复性故障。在这项工作中,我们在化学领域对 CLIR 进行了基准测试,重点关注专利数据。我们根据 Google 专利和欧洲专利局 (EPO) 数据构建了一个多语言数据集,涵盖五种语言(涵盖主要的东西方语言),反映了现实世界工业文档的多样性和复杂性。使用该数据集,我们系统地评估了八种最先进的跨语言检索嵌入模型。我们的结果显示单语言和跨语言设置之间存在巨大的性能差距:对于性能最佳的模型,Recall@10 在跨语言设置中从 0.72 下降到 0.53。检索深度也显着下降,在跨语言场景中相关文档的跨语言排名较低。此外,一些在单语言环境中表现出色的多语言嵌入模型在查询和文档采用不同语言时表现出急剧下降,这为跨语言用例中的模型选择提供了实用的见解。这些发现强调了当前方法的关键局限性,并强调在特定领域设置中需要更强大的跨语言检索方法。我们的基准测试为模型选择提供了可行的见解,并为工业技术文本上的 CLIR 建立了受控诊断评估框架。数据和代码可通过此 https URL 公开获取。