论文

SIGMA:分子自回归的语义标识符分组

SIGMA: Semantic Identifier Grouping for Molecular Autoregression

模型训练预训练

摘要

自回归分子模型将概率分配给分子序列化,即使化学特性对于序列化是不变的。因此,等效序列化可以代表共同的分子身份,但会导致不一致的下一个标记决策。随机字符串扩大了曝光度,但没有揭示哪些中间决策应该达成一致。我们引入了 SIGMA,这是一种由化学认证的相同后缀三元组构建的密集后缀位置目标:两个等效历史、一个非等效历史和一个共享后缀。 SIGMA 沿着延续对齐相应的预标记隐藏状态,并将负数分隔到有限的相对边缘,保持语言模型目标、解码器和推理过程不变。我们将 SIGMA 与 SMILES 和 SELFIES 下四个数据集的规范训练、随机序列化训练和最后标记对齐进行比较。在八个表示数据集块中,SIGMA 产生了六种清晰的测试参考 Frechet ChemNet 距离减少:所有四个 SELFIES 域以及 SMILES 下的 QM9 和 ZINC,每个对照的配对 95% 置信区间都低于零。位置分析表明,在保留分子间信息的同时,状态对应性、化学辨别力和下一个标记一致性得到了改善。在两个全语料库 ZINC 块上,计算匹配的消融将化学上正确的状态对应识别为有效成分。除了生成之外,SIGMA 还提高了所有六个分子特性基准的平均预测性能,并降低了每项任务对等效分子序列化的敏感性。