论文

闭环贝叶斯分子逆设计:使用大语言模型语义代理模型

Closed-Loop Bayesian Molecular Inverse Design with Semantic LLM Surrogates

智能体系统Agent 架构与控制循环

摘要

实际分子逆设计很少通过一次生成完成,通常是在有限的属性评估预算下,闭环扩充分子候选池,提高满足目标属性的分子比例。贝叶斯优化适合这一场景,但常规高斯过程代理模型使用压缩连续嵌入,容易丢失化学家用来决定下一步搜索位置的子结构与参考相似性信息。BoMolLLM把设计选择放在代理模型而非生成器中:冻结的大语言模型直接读取任务指令、SMILES形式的优化历史与属性评估反馈。每轮代理模型根据探索与利用原则选择有信息价值的参考分子,并可附简短指导语;结构化决策被转换为下一轮冻结分子生成器的条件文本,形成可检查的自然语言优化轨迹。MolQA药物和材料设计实验显示,BoMolLLM优于单次提示,与基于高斯过程的贝叶斯优化基线相当或更好。信息接口的效果随领域而变:二元药物靶标任务仅传递参考分子效果最好,连续材料属性任务则更受益于附加简短代理模型总结。