论文

化学语言模型的不确定性感知强化学习

Uncertainty-aware reinforcement learning for chemical language models

模型训练强化学习

摘要

强化学习 (RL) 已成为从头分子设计的强大范例,使化学语言模型 (CLM) 能够导航和探索化学空间,同时优化特定的所需属性。然而,现有的强化学习框架将所有评分函数视为确定性预言,忽略了不同分子特性预测所固有的不确定性。这可以导致对化学空间高度不确定区域的探索,重点关注训练数据支持很少的高评分分子的生成。这可能会破坏优化过程的稳定性,产生与其真实值相差甚远的预测。我们提出并比较了将预测不确定性纳入强化学习的两种互补方法。在第一个中,不确定性被视为额外的优化目标,并与其余评分函数一起合并,允许策略在利用与可靠性之间进行权衡。其次,不确定性用于调节策略更新,减少其属性远远超出评分函数置信域的分子的影响。这两种方法都在三种不同的设置下进行了评估:(i)受控模型系统,其中预测误差被建模为高斯分布,方差与训练数据的距离成正比;以及两个现实世界的任务,利用 (ii) ChemProp 模型和 (iii) 应用于随机森林分类器的保形预测包装器。我们表明,不确定性感知强化学习使 CLM 能够通过偏向不确定性较低的区域来更稳健地探索化学空间。这可以在不影响分子评分的情况下实现更可靠的命中发现,将真实命中率提高 0.25(从 0.5 到 0.75),并使真实命中总数几乎翻倍。