论文

ChemVLR:优先考虑化学视觉语言理解的感知推理

ChemVLR: Prioritizing Reasoning in Perception for Chemical Vision-Language Understanding

模型训练合成数据

摘要

虽然视觉语言模型(VLM)在化学视觉理解方面表现出了巨大的潜力,但当前的模型主要针对直接视觉问答任务进行了优化。这种范例通常会导致“黑匣子”系统无法利用 大语言模型 (LLM) 的固有功能来推断潜在的反应机制。在这项工作中,我们引入了 ChemVLR,这是一种化学 VLM,旨在优先考虑感知过程中的推理。与传统的化学 VLM 不同,ChemVLR 在生成答案之前,通过明确识别颗粒化学描述符(例如官能团),以细粒度的方式分析视觉输入。这种方法确保为复杂的视觉化学问题生成明确且可解释的推理路径。为了促进这种方法的实施,我们实施了跨模态逆向工程策略,并结合严格的过滤管道,以策划一个大规模推理和描述数据集,其中包含跨分子和反应任务的 76 万个高质量样本。此外,我们采用三阶段训练框架,系统地构建模型感知和推理能力。实验表明,ChemVLR 实现了最先进的 (SOTA) 性能,超越了领先的专有模型和特定领域的开源基线。我们还提供全面的消融研究来验证我们的训练策略和数据生成设计。代码和模型权重将在 https://github.com/xxlllz/ChemVLR 上提供。