真实数据缩小了光学化学结构识别中合成与真实的差距
Real Data Closes Synthetic-to-Real Gap in Optical Chemical Structure Recognition
摘要
数以百万计的化学结构仅以图纸的形式出现在专利和论文中,大规模使用这些信息需要阅读图纸。 OCSR 在合成图像上似乎已接近解决,但在真实文档上仍然很困难:起始识别器 Qwen2.5-VL-7B 在合成渲染上的准确率超过 91%,但在三个真实世界基准(ACS、CLEF-IP、USPTO)上低于 16%。为了确定改进的主要来源,对 21 个识别器进行了微调,其中包括合成渲染结构的混合物以及来自专利、期刊图片和手绘集合的标记真实描述,改变视觉语言模型 (VLM) 基础、真实训练数据的比例以及视觉塔适应策略。带标签的真实训练图像产生最大的差异。对于Qwen2.5-VL,ACS精确匹配从没有真实数据的0.15上升到9.5%的0.37和50.2%的0.46;三个基本模型的对照实验再现了这一趋势。相比之下,视觉塔 LoRA 对 Qwen(+0.00,配对 p=1.00)没有任何作用,对 InternVL3-8B 有很大帮助(+22.8 至 +34.6 pt),对 GLM-4.1V-9B 有一定帮助(+1.0 至 +9.6 pt),因此其价值取决于基础模型。最佳配置在干净渲染上达到 0.96 精确匹配,在 ACS、CLEF-IP、UOB 和 USPTO 上分别达到 0.49、0.65、0.84 和 0.76。没有真实数据时基础模型之间的差距最大(0.21),在70%真实数据时缩小到0.06,并重新排序排名;因此,必须一起选择基础模型和实际数据混合。关于手写图像到 LaTeX 识别和图表到表格转换的小规模实验表明,基本模型排名也不同于化学。更一般地说,视觉结构识别的模型和适应选择应该根据目标任务进行评估。