论文
VILLA:使用 大语言模型 从科学文献中检索多功能信息
VILLA: Versatile Information Retrieval From Scientific Literature Using Large LAnguage Models
摘要
缺乏训练机器学习 (ML) 模型的高质量 真值 数据集阻碍了人工智能 (AI) 在科学研究中的潜力。使用 LLM 从文献中提取科学信息 (SIE) 正在成为自动创建这些数据集的强大方法。然而,现有的基于 LLM 的 SIE 方法和基准研究侧重于生物医学和化学等广泛主题,仅限于基于选择的任务,并且侧重于从简短且格式良好的文本中提取信息。 SIE 方法在复杂、开放式任务中的潜力尚未得到充分开发。在这项研究中,我们使用了 SIE 中几乎被忽视的一个领域,即病毒学,来解决这些研究空白。我们设计了一个独特的、开放式的 SIE 任务,提取给定病毒中的突变,从而改变其与宿主的相互作用。我们为 SIE 开发了一种新的多步骤检索增强生成 (RAG) 框架,称为 VILLA。与此同时,我们整理了从 239 份科学出版物中获得的 10 种甲型流感病毒蛋白的 629 个突变的新数据集,作为突变提取任务的 真值。最后,我们通过新颖且全面的评估以及与 vanilla RAG 以及其他最先进的 RAG 和基于代理的 SIE 工具的比较,展示了 VILLA 的卓越性能。