论文

SLIM:用于可解释和属性导向的稀疏潜在转向基于 LLM 的分子编辑

SLIM: Sparse Latent Steering for Interpretable and Property-Directed LLM-Based Molecular Editing

模型训练模型编辑与遗忘

摘要

大语言模型具有强大的化学推理能力,使其成为有效的分子编辑器。然而,与属性相关的信息隐式地缠绕在其密集的隐藏状态中,没有为属性控制提供明确的处理:很大一部分编辑无法改善甚至降低目标属性。为了解决这些问题,我们提出了 SLIM(稀疏潜在可解释分子编辑),这是一种即插即用框架,可通过具有可学习重要性门的稀疏自动编码器将编辑器的隐藏状态分解为稀疏的、属性对齐的特征。在这个稀疏的特征空间中进行引导可以精确地激活属性相关的维度,从而在不修改模型参数的情况下提高编辑成功率。同样的稀疏基础进一步支持编辑行为的可解释分析。在 MolEditRL 基准测试中,针对四种模型架构和八种分子特性进行的实验显示,与基线相比具有一致的增益,提升幅度高达 42.4 点。