自动驾驶数据集:从 2000 万篇论文到大规模细致入微的生物医学知识
Self-Driving Datasets: From 20 Million Papers to Nuanced Biomedical Knowledge at Scale
摘要
手动管理的生物医学存储库(涵盖生物活性、基因组学和化学)维护成本高昂,落后于原始文献,并且丢弃实验背景,模糊了评估数据正确性和覆盖范围所需的细微差别。我们表明,PubMed 本身可以自主且经济高效地转化为结构化数据集,这些数据集比它们所取代的精选数据库更大、更细致、更准确。我们提出了三个耦合贡献:(1)基于 LLM 的实体标记管道,以九种生物医学本体为基础,在 2250 万篇论文、2.5T 词元 PubMed 语料库中标记 19 个类别的 4.5B 个实体; (2)混合稀疏-密集检索,支持对标记语料库进行实体过滤语义查询; (3) Starling,一个多智能体深度研究系统,仅给定自然语言任务描述,设计以精确度和召回为目标的检索过滤器,引入提取模式,并发出具有细微差别的字段和支持段落的结构化记录。在六项任务中——血脑屏障渗透性、口服生物利用度、急性毒性 (LD50)、基因疾病关联、蛋白质亚细胞定位和化学反应——Starling 生成约 630 万条记录(每个任务 91K-3M);据我们所知,其中一些是其财产的最大公共数据集。我们提取的前沿模型在各个任务中的拒绝率为 0.6-7.7%,远低于我们在广泛使用的策划对应项上测量的错误率(例如,BBB_Martins 为 16.5%,Bioavailability_Ma 为 7.3%)。除了规模和准确性之外,支持段落还带有表格数据库丢弃的细微差别——例如,口服生物利用度可能取决于进食状态与禁食状态。语料库、检索和代理共同为人工智能驱动的治疗设计奠定了基础。代码和数据集:https://github.com/starling-labs/starling。