论文
Diffusion Drafts、AR 验证:通过自推测解码加速文档 OCR
Diffusion Drafts, AR Verifies: Accelerating Document OCR with Self-Speculative Decoding
摘要
自回归 OCR 视觉语言模型可以准确地将文档图像转换为文本和结构化标记,但每个输出标记都需要一个顺序解码步骤,从而限制了推理速度。与开放式文本生成不同,OCR 输出牢固地基于输入图像,这使得基于扩散的并行生成很有前景。然而,当在一个扩散步骤中预测多个标记时,每个标记都会在其他标记已知之前被预测。因此,直接提交它们可能会引入错误。因此,我们引入了 GravityOCR,这是一种参数共享的 AR 块扩散模型,经过联合训练,用于并行绘图和因果 AR 验证。在提交之前验证草稿可以让模型在每轮提交多个输出词元,而无需单独的起草网络。因果 AR 路径还使 GRPO 能够获得序列级和结构级 OCR 奖励,从而在更新共享绘图器参数时避免扩散轨迹似然估计。在 OmniDocBench v1.6 上,AR 路径 GRPO 将总体得分从 94.92 提高到 95.16,而没有降低扩散绘图效率,而最终模型仍接近原始 GLM-OCR 得分 95.48。在 SGLang 服务部署中,GravityOCR 平均每次前向传递提交 9.7 个输出词元,并在区域作物上实现 $3.94\times$ 仅解码加速,并在 AR 解码上实现 $1.32\times$ 端到端页面处理加速。