论文

确定性自扩展反应分类的可验证规则智能体生成

Agentic generation of verifiable rules for deterministic, self-expanding reaction classification

应用与实践科学研究

摘要

计算机辅助合成规划使用大型反应规则库把目标分子分解为可得前体——每条转换被赋予确定性、可解释的标签。但化学是长尾的——手工编码不可行,既有工具依赖无法适应新化学的固定规则集。我们提出完全自动化的管线:多Agent LLM框架在665,901个美国专利反应上分类反应并自行编写规则——每条规则在验证回路中对照语料测试生成。它将标准分类从68类扩展到14,073类而无需人工策展。以轻量指纹分类器对未见反应分类达97.7%——匹敌领先的专有分类器同时更精细地解析化学并按需扩展到训练分布之外的化学。

确定性自扩展反应分类的可验证规则智能体生成:论文配图
图 1:用于动态分类扩展的多代理大语言模型框架。原始反应数据和种子层次结构由连续的高级和详细分类代理进行评估。验证代理审核提议的标签;当现有类别不足或不精确时,标签生成代理会提出新的分类。分类更新程序集成了这些建议,动态扩展层次结构以捕获未表示的化学反应,无需人工干预,从而扩展反应分类。 b.用于生成反应模板的迭代细化循环。大语言模型起草初始、广泛的 SMIRKS 模式(低特异性、高召回率),并根据反应数据进行自动验证。通过连续迭代,大语言模型应用基于化学的结构突变来最大限度地减少假阳性,同时最大限度地提高真阳性召回率,从而产生一个强大的通用、高特异性反应模板数据库。