论文
Jina-OCR-v1:使用 推测解码 进行高效文档解析和密集可验证奖励
Jina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards
摘要
我们推出了 Jina-OCR-v1,这是一种专为低预算 GPU 服务而构建的端到端文档解析模型。它结合了 DeepSeek-OCR 的压缩视觉编码器和 3B 专家混合解码器,每个词元激活约 570M 个参数,以及 FastMTP 推测解码 头,该头在 K=3 预测步骤中递归共享单个草稿块。贪心验证使得解码无损。 后训练 结合了指令对齐、困难文档的稳健性 微调 以及密集可验证奖励下的 GRPO:确定性公式、表格和授予部分学分的结构检查。训练数据将清理后的公共语料库与目标合成页面混合在一起。在默认动态分辨率设置下,Jina-OCR-v1 在 OmniDocBench v1.6 上得分为 91.14,在 olmOCR-Bench 上得分为 83.4,并在我们的比较中达到最高页面吞吐量,每秒 2.57 页。在 NVIDIA L4 等低预算 GPU 上,FastMTP 的解码速度是贪婪自回归解码的两倍。该模型可在 https://huggingface.co/jinaai/jina-ocr-v1 上公开获取。