论文

科学出版物记录中资助者名称消歧的多功能嵌入模型

Multi-Functional Embedding Models for Funder Name Disambiguation in Scientific Publication Records

模型训练监督微调与指令调优

摘要

了解研究经费的历史分配和分布可以增进我们对如何跨领域、机构和地区支持科学研究的了解。然而,由于缺乏全面的资助者名称消歧解决方案,大规模分析受到阻碍,因为资助者名称经常表现出拼写变化、翻译、缩写和不一致的粒度级别。在本文中,我们提出了一个开发多语言、多功能资助者姓名消歧模型的框架,并展示了其在生物多样性保护研究出版物中的应用。为了构建训练数据集,我们将研究组织注册表 (ROR)(为研究组织提供唯一标识符)与两个出版物数据集集成:Web of Science (WoS) 和 Crossref 开放资助者注册表 (OFR)。我们使用多任务学习与对比损失和多重否定排名损失来微调来自句子 Transformer、Gemma 和 Qwen3 系列的三个开放权重嵌入模型。当将 WoS 资助者名称与 ROR 标识符进行匹配时,表现最好的模型的准确度达到了 0.90 以上,比通用 LLM(包括 GPT-5.2、Claude-Sonnet-4.6 和 Gemini-2.5-Flash)的性能高出了 0.1 以上。对于未在 ROR 中索引的资助者名称,我们在资助者名称之间构建了一个相似性网络,并在其中识别了集群。最后,我们分析了消歧结果,并强调了由于小型资助者和非英语国家资助者知识有限而带来的挑战。这项工作为资助者名称消歧提供了一个可重用的框架,具有跨不同模型架构和数据集的潜在适用性,具有成本效益高的训练数据创建以及多任务学习和消歧功能。