论文
BioMiner:从文献自动挖掘蛋白质-配体生物活性数据的多模态系统
BioMiner: A Multi-modal System for Automated Mining of Protein-Ligand Bioactivity Data from Literature
摘要
文献中发表的蛋白质-配体生物活性数据对药物发现至关重要,但人工整理难以跟上快速增长的文献。自动化的生物活性提取仍然充满挑战,因为它不仅需要解读分布在文本、表格和图片中的生化语义,还需要重建化学上精确的配体结构(例如Markush结构)。为突破这一瓶颈,我们提出BioMiner,一个将生物活性语义解读与配体结构构建显式分离的多模态提取框架。在BioMiner中,生物活性语义通过直接推理获得,而化学结构则通过以化学结构为依据的视觉语义推理范式来解析——多模态大语言模型在符合化学结构的视觉表示上操作以推断结构间关系,精确的分子构建则交给领域化学工具。为进行严格评估与方法研发,我们进一步建立了BioVista,一个包含从500篇文献中整理出的16,457条生物活性条目的综合基准。BioMiner验证了其提取能力并提供了定量基线,在生物活性三元组上取得0.32的F1分数。BioMiner的实用价值通过三个应用得到展示:(1)从11,683篇论文中提取82,262条数据,构建将下游模型性能提升3.9%的预训练数据库;(2)支持人机协同工作流,将高质量NLRP3生物活性数据量翻倍,助力28个QSAR模型取得38.6%的提升,并识别出16个具有新颖骨架的候选命中化合物;(3)加速蛋白质-配体复合物生物活性注释,在PoseBusters数据集上相比人工流程实现5.59倍提速和5.75%的准确率提升。
