Bolek:分子推理的多模态语言模型
Bolek: A Multimodal Language Model for Molecular Reasoning
摘要
分子特性模型越来越多地支持高风险的药物发现决策,但它们的输出通常难以审核:经典预测器返回没有理由的分数,而语言模型可以产生基于输入分子的流畅解释。我们介绍了 Bolek,一种紧凑的多模态语言模型,通过将摩根指纹嵌入注入指令调整的文本解码器中,将自然语言推理建立在分子结构中。 Bolek 在分子比对任务上进行了微调,包括分子描述、RDKit 描述符预测和子结构检测,以及使用锚定于具体分子特征的合成思想链对 15 个 TDC 二元分类任务进行下游推理。在这些任务中,Bolek 在是/否模式下的所有端点以及在思维链模式下的 15 个端点中的 13 个上均优于其 Qwen3-4B-Instruct 基础,将平均 ROC/PR AUC 从 0.55 提高到 0.76。尽管其大小还不到 TxGemma-9B-Chat 的一半,但它在 15 个二元分类任务中的 13 个上表现优于 TxGemma-9B-Chat。 Bolek 的解释比基线 LLM 的解释更有根据:它在每个思想链中引用数字描述符的频率高出 10-100 倍,并且引用的值与 RDKit 对于 TPSA、MolLogP 和 MolWt 等关键描述符的值非常一致(Spearman rho = 0.87-0.91)。泛化超出了训练面板的范围:在 15 个未见的 TDC 分类端点上,Bolek 在 5 个端点上与 TxGemma 匹配,并且它在三个保留的回归端点上产生了非平凡的排名相关性,尽管在训练期间从未看到下游回归。这些结果表明,与可验证的分子特征相关的有针对性的模态注入和推理监督可以产生紧凑的、可审计的分子推理模型。