论文

无限 OCR 作品

Unlimited OCR Works

模型推理KV Cache

摘要

最近,以DeepSeek OCR为代表的端到端OCR模型再次将OCR推向了人们的视线。一种广泛持有的观点是,采用 大语言模型 (LLM) 作为解码器允许模型利用语言的先验分布,从而提高 OCR 性能。然而,缺点也同样明显:随着输出序列的延长,累积的 KV 缓存会增加内存消耗并逐渐减慢生成速度。这与人类形成鲜明对比,人类在执行长视距复制任务时并没有表现出效率下降的情况。在这份技术报告中,我们提出了 Unlimited OCR,一种旨在模拟人类解析工作记忆的模型。以 DeepSeek OCR 为基准,我们用我们提出的参考滑动窗口注意力(R-SWA)替换解码器中的所有注意力层,这降低了注意力计算成本,同时在整个解码过程中保持恒定的 KV 缓存。通过将 DeepSeek OCR 编码器的高压缩率与我们的恒定 KV 缓存设计相结合,Unlimited OCR 可以在标准最大长度 32K 的情况下在单次前向传递中转录数十页文档。更重要的是,R-SWA 是一种通用的解析注意力机制——除了 OCR 之外,它同样适用于 ASR、翻译等任务。代码和模型权重可在 http://github.com/baidu/Unlimited-OCR 上公开。