论文

RTPrune:两次阅读启发的词元修剪,用于高效的 DeepSeek-OCR 推理

RTPrune: Reading-Twice Inspired Token Pruning for Efficient DeepSeek-OCR Inference

模型推理推理加速

摘要

DeepSeek-OCR 利用视觉文本压缩来降低长文本处理成本并加速推理,但视觉标记仍然容易出现冗余文本和结构信息。此外,由于压缩机制不正确,当前用于传统视觉语言模型(VLM)的标记修剪方法无法保持文本保真度。通过分析 DeepSeek-OCR 的解码过程,我们发现了一个明显的两阶段阅读轨迹:模型最初优先考虑大多数高范数标记,然后将注意力重新分配到剩余的标记上。受这一见解的启发,我们提出了 RTPrune,这是一种为 DeepSeek-OCR 量身定制的两阶段词元修剪方法。在第一阶段,我们优先考虑捕捉显着文本和结构信息的高标准视觉标记。在第二阶段,基于最优传输理论对剩余词元进行配对和合并,以实现高效的特征聚合。我们进一步引入了动态修剪比率,该比率可适应 OCR 任务的标记相似性和文本密度,从而实现更好的效率与准确性权衡。大量实验证明了最先进的性能,OmniDocBench 上的准确度为 99.47%,预填充速度提高了 1.23倍,当应用于 DeepSeek-OCR-Large 时,词元保留率达到 84.25%。