论文
从语法到语义:揭示 SMILES 翻译模型中手性的出现
From Syntax to Semantics: Unveiling the Emergence of Chirality in SMILES Translation Models
摘要
了解化学语言模型 (CLM) 如何从分子字符串表示中学习化学含义,而不仅仅是表面级字符串模式,是化学表示学习和化学机器学习中的一个重要问题。手性提供了一个要求严格的测试案例:对映体在药理活性和毒性方面可能存在很大差异,但 CLM 往往很难可靠地区分手性构型。在这里,我们提出了 Pan-CORE(泛化学全尺度表示引擎),这是一系列基于 Transformer 的自回归编码器-解码器模型,用于 SMILES 翻译,并使用高时间分辨率检查点分析来研究在训练过程中如何学习手性信息。在所有测试的 Pan-CORE 变体中,我们观察到可重复的跳跃,其中手性标记准确度在长时间的平台期后突然上升,这表明手性学习停滞不能仅由模型容量来解释,而是反映了手性约束的复杂性。对注意力动态、残差流轨迹和潜在空间几何的分析支持以编码器为中心的机制,其中手性标记表示经历瞬时不稳定和重建,被视为向量范数和方向稳定性的 V 形下降和恢复,以及潜在空间中手性分子表示的清晰重组。编码器-解码器交叉评估进一步支持以编码器为中心的转换性质,并且有针对性的注意力头消融识别了一小部分手性敏感头,即使在完全训练的模型中,其去除也会选择性地降低手性词元的准确性。这些发现表明,SMILES 翻译可以作为 CLM 中语义出现机制分析的有用实验系统,对可解释的化学表示学习具有影响。