论文

使用 大语言模型 进行支架条件偏好三联体的可控分子优化

Scaffold-Conditioned Preference Triplets for Controllable Molecular Optimization with Large Language Models

模型训练偏好优化

摘要

分子特性优化是药物发现的核心,但许多深度学习方法依赖于黑盒评分,并且对支架保存的控制有限,通常会产生不稳定或生物学上不可信的编辑。虽然 大语言模型 (LLM) 是有前途的分子发生器,但由于缺乏基于化学的偏好监督和有原则的数据管理,优化仍然受到限制。我们引入了 \textbf{Scaffold-Conditioned Preference Triplets (SCPT)},这是一个通过脚手架对齐和化学驱动过滤器构建相似性约束三元组 $\langle\text{scaffold}、\text{better}、\text{worse}\rangle$ 的管道,以实现有效性、可合成性和有意义的属性增益。使用这些首选项,我们将预训练的分子 LLM 作为条件编辑器,从而实现保留支架的属性改进编辑。在单目标和多目标基准中,SCPT 提高了优化成功率和财产增益,同时保持比竞争基准更高的支架相似性。与代表性的非 LLM 分子优化方法相比,经过 SCPT 训练的 LLM 更适合支架约束和多目标优化。此外,在单属性和二属性监督上训练的模型可以有效地推广到三属性任务,这表明在有限的高阶监督下具有良好的外推泛化能力。 SCPT 还提供可控的数据构建旋钮,产生可预测的相似性增益前沿,从而能够系统地适应不同的优化机制。