论文
大语言模型能否可靠地注释生物测定元数据以提高数据准备情况?
Can LLMs Reliably Annotate Bioassay Metadata to Improve Data Readiness?
摘要
分子特性预测基础模型的出现需要高度的人工智能数据准备,包括可靠的元数据注释。然而,公共存储库和工业筛选数据库都存在缺失、不一致或混淆的分析注释问题。在这项工作中,我们量化了 PubChem 中 BioAssay Ontology (BAO) 测定格式和物理检测方法领域缺失注释的程度,并研究开源和专有的大语言模型 (LLM) 是否可以直接从测定文本中可靠地预测和审核元数据注释。在我们的评估中,我们发现 PubChem 的 $\sim$2 百万个生物测定的注释覆盖率极其稀疏,36\% 缺乏测定格式,89\% 为生物测定类型,以及 >99.9\% 的任何 BAO 映射测定格式或检测技术术语。这激发了对自动化测试元数据管理的需求。使用源自 PubChem 和 ChEMBL 的评估集,我们评估了七个开源和专有大语言模型与现有银标签的协议。对于生化和基于细胞的检测格式,召回率至少为 0.96,检测技术具有类似的模式,尽管对代表性不足的类别的分歧有所增加。手动检查表明,许多分歧可以追溯到银源之间的不一致,而不是大语言模型错误。此外,在一位高级工业管理者的定性研究中,大语言模型生成的证据促使专家修改了他们自己的一些标签,表明大语言模型可以标记潜在的标签错误的检测。在整个研究中,专有模型和开源模型之间的性能差异很小。总之,这些结果表明大语言模型可以支持检测元数据的大规模注释和审核,尽管在此类标签进入下游 ML 管道之前,每个类别的可靠性估计和有针对性的人工审核仍然是必要的。