论文

BioMiner:从文献自动挖掘蛋白质-配体生物活性数据的多模态系统

BioMiner: A Multi-modal System for Automated Mining of Protein-Ligand Bioactivity Data from Literature

应用与实践科学研究

摘要

文献中发表的蛋白质-配体生物活性数据对药物发现至关重要,但人工整理难以跟上快速增长的文献。自动化的生物活性提取仍然充满挑战,因为它不仅需要解读分布在文本、表格和图片中的生化语义,还需要重建化学上精确的配体结构(例如Markush结构)。为突破这一瓶颈,我们提出BioMiner,一个将生物活性语义解读与配体结构构建显式分离的多模态提取框架。在BioMiner中,生物活性语义通过直接推理获得,而化学结构则通过以化学结构为依据的视觉语义推理范式来解析——多模态大语言模型在符合化学结构的视觉表示上操作以推断结构间关系,精确的分子构建则交给领域化学工具。为进行严格评估与方法研发,我们进一步建立了BioVista,一个包含从500篇文献中整理出的16,457条生物活性条目的综合基准。BioMiner验证了其提取能力并提供了定量基线,在生物活性三元组上取得0.32的F1分数。BioMiner的实用价值通过三个应用得到展示:(1)从11,683篇论文中提取82,262条数据,构建将下游模型性能提升3.9%的预训练数据库;(2)支持人机协同工作流,将高质量NLRP3生物活性数据量翻倍,助力28个QSAR模型取得38.6%的提升,并识别出16个具有新颖骨架的候选命中化合物;(3)加速蛋白质-配体复合物生物活性注释,在PoseBusters数据集上相比人工流程实现5.59倍提速和5.75%的准确率提升。

BioMiner:从文献自动挖掘蛋白质-配体生物活性数据的多模态系统:论文配图
图 1:蛋白质-配体生物活性提取框架 BioMiner 和基准 BioVista 概述。 (a)整个蛋白质-配体生物活性提取框架BioMiner。 (b)化学结构萃取剂。在该代理中,显式完整结构和马库什结构都被处理。为了澄清起见,显式完整结构绘制在紫色框中,马库什支架和 R 基团取代基绘制在蓝色框中。 (c) 新基准 BioVista,包含来自 500 份出版物的 16,457 个生物活性数据和 8,735 个结构作为真实标签。基于这些数据,设计了从组件级任务到端到端任务的六个评估任务来进行综合评估。