论文

微调 DeepSeek-OCR-2 用于分子结构识别

Fine-tuning DeepSeek-OCR-2 for Molecular Structure Recognition

应用与实践科学研究

摘要

光学化学结构识别 (OCSR) 对于将二维分子图从印刷文献转换为机器可读格式至关重要。虽然视觉语言模型在端到端 OCR 任务中表现出了希望,但它们直接应用于 OCSR 仍然具有挑战性,并且直接全参数监督 微调 经常失败。在这项工作中,我们通过将任务制定为图像条件 SMILES 生成,将 DeepSeek-OCR-2 应用于分子光学识别。为了克服训练的不稳定性,我们提出了一种两阶段渐进式监督 微调 策略:从参数高效的 LoRA 开始,过渡到具有分割学习率的选择性全参数 微调。我们在大规模语料库上训练我们的模型,该语料库结合了 PubChem 的合成渲染图和 USPTO-MOL 的真实专利图像,以提高覆盖率和稳健性。我们的微调模型 MolSeek-OCR 展示了竞争能力,实现了与性能最佳的图像到序列模型相当的精确匹配精度。然而,它仍然不如最先进的图像到图形模型。此外,我们探索了强化式 后训练 和基于数据管理的细化,发现它们无法提高精确 SMILES 匹配所需的严格序列级保真度。