论文

ArmorOCR:通过观察转移自我实现扎根的对抗性视觉感知-蒸馏

ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation

摘要

大型多模态模型 (LMM) 已表现出强大的 OCR 识别能力,但仍然容易受到人类可读的对抗性视觉文本的影响,但对模型的本地化和识别来说却具有挑战性。现有的 OCR 基准主要关注自然或文档风格的文本,而对抗性 OCR 评估在规模、任务覆盖范围或区域感知评估方面仍然有限。在本文中,我们将对抗性 OCR 制定为 \textbf{grounded OCRception} 任务,并引入 \textbf{AdvSpot},这是扎根对抗性 OCR 评估的第一个基准。 AdvSpot 包含 390 张带有区域级注释的图像,涵盖 5 个主要类别和 13 种细粒度对抗性 OCR 类型。为了应对这一挑战,我们提出了 \textbf{ArmorOCR},这是一个用于强大的对抗性 OCR 感知的两阶段训练框架。 ArmorOCR 首先通过 同策略 Self-蒸馏 (OPSD) 从特权转换观察中获取缺失的对抗性 OCR 感知,然后通过组相对策略优化 (GRPO) 以及针对本地化、识别、全面定位和视觉问答 (VQA) 的任务条件奖励来完善基础 OCR 感知。在我们的 AdvSpot、其他对抗性 OCR 基准和通用 OCR 基准上进行的实验表明,ArmorOCR 持续改善对抗性 OCR 感知,同时保持有竞争力的通用 OCR 能力。