论文
ChemVA:推进大语言模型对化学反应图的理解
ChemVA: Advancing Large Language Models on Chemical Reaction Diagrams Understanding
摘要
尽管大语言模型(LLM)已彻底改变了科学文本处理,但在解读化学反应图时存在显著的能力差距。我们识别出制约现有系统的两个根本瓶颈:一是视觉缺陷(Visual Deficit),即通用视觉编码器难以解析稠密分子图的严格拓扑连接;二是语义脱节(Semantic Disconnect),即SMILES等标准线性字符串无法有效激活模型的潜在化学推理。为弥合这些差距,我们提出Chemical Visual Activation(ChemVA)框架,它采用Visual Anchor机制通过混合粒度检测来定位官能团,随后通过语义对齐方法将视觉特征转化为实体名称,以最大化LLM中的知识激活。我们在OCRD-Bench上评估所提方法,这是一个新构建的数据集,具有稠密的视觉-语义上下文和全面的反应覆盖,可用于评估从识别到推理的全部能力谱系。在OCRD-Bench上的大量实验表明,ChemVA达到92.0%的结构识别准确率。通过弥合视觉与语义瓶颈,我们的框架在9个不同LLM上带来约20个百分点的稳定性能提升,使开放权重模型在复杂化学推理任务上可与专有SOTA系统相媲美。
