论文

MolDeTox:评估语言模型面向分子脱毒的分步片段编辑

MolDeTox: Evaluating Language Model's Stepwise Fragment Editing for Molecular Detoxification

模型评测基准与评测资源

摘要

大语言模型(LLM)与视觉语言模型(VLM)近来在多个科学领域展现出可观的能力。这些进展尤其为药物发现开辟了新机会:在该领域中,理解并修改分子结构的能力对优化药效、毒性等药物属性至关重要。然而,现有模型与基准往往忽视毒性相关挑战,主要聚焦一般性质优化,而未充分顾及安全性问题。此外,即便是现有的毒性修复基准,也存在数据多样性有限、生成分子的结构有效性低,以及毒性评估严重依赖代理模型等问题。为解决这些局限,我们提出MolDeTox,一个全新的分子脱毒基准,旨在跨分步任务对兼顾毒性的分子优化进行细粒度且可靠的评估。我们在多种设定下评估了大量通用LLM与VLM,并证明在片段层面理解与生成分子可以提升结构有效性并改善生成分子的质量。此外,通过细致的任务级性能分析,MolDeTox提供了一个可解释的基准,有助于更深入地理解脱毒过程。我们的数据集发布于:https://huggingface.co/datasets/MolDeTox/MolDeTox

MolDeTox:评估语言模型面向分子脱毒的分步片段编辑:论文配图
图6:Ames致突变性关联前20片段的结构警报重叠分析,展示片段级毒性归因。