论文

ChemVA:推进大语言模型对化学反应图的理解

ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding

应用与实践科学研究

摘要

尽管大语言模型(LLM)已彻底改变了科学文本处理,但在解读化学反应图时存在显著的能力差距。我们识别出制约现有系统的两个根本瓶颈:一是视觉缺陷(Visual Deficit),即通用视觉编码器难以解析稠密分子图的严格拓扑连接;二是语义脱节(Semantic Disconnect),即SMILES等标准线性字符串无法有效激活模型的潜在化学推理。为弥合这些差距,我们提出Chemical Visual Activation(ChemVA)框架,它采用Visual Anchor机制通过混合粒度检测来定位官能团,随后通过语义对齐方法将视觉特征转化为实体名称,以最大化LLM中的知识激活。我们在OCRD-Bench上评估所提方法,这是一个新构建的数据集,具有稠密的视觉-语义上下文和全面的反应覆盖,可用于评估从识别到推理的全部能力谱系。在OCRD-Bench上的大量实验表明,ChemVA达到92.0%的结构识别准确率。通过弥合视觉与语义瓶颈,我们的框架在9个不同LLM上带来约20个百分点的稳定性能提升,使开放权重模型在复杂化学推理任务上可与专有SOTA系统相媲美。

ChemVA:推进大语言模型对化学反应图的理解:论文配图
图 1.基于 LLM 的化学反应图理解和提出的 ChemVA 框架的局限性概述。 (a) 现有管道在反应图解析中表现出视觉缺陷,并且在基于 SMILES 的表示下存在语义脱节。 (b) ChemVA 通过基于功能组的反应图解析和下游推理的语义激活来弥补这些差距。