论文
Xiaomi-OCR-0技术报告
Xiaomi-OCR-0 Technical Report
摘要
紧凑的 OCR 特定视觉语言模型可实现强大的文档解析性能,但通常依赖于昂贵的监督,并且主要关注视觉文本重建。我们引入了Xiaomi-OCR-0,一个用于文档解析和以OCR为中心的理解的统一0.8B模型。我们使用自动化数据引擎构建了大约 1.7 亿样本的以 OCR 为中心的语料库,该引擎结合了专家共识、基于渲染的验证和目标合成。从 Qwen3.5-0.8B 开始,我们的渐进式训练方案结合了基于 Q-Mask 的文本锚定、持续预训练和混合任务强化学习 (Mix-RL)。Xiaomi-OCR-0 在 Real5-OmniDocBench 上获得 95.24 分,在 OmniDocBench v1.6 上获得 96.83 分,在 Wild-OmniDocBench 上获得 87.94 分,同时在五个面向 OCR 的 VQA 基准测试中平均得分为 83.2 分。消融进一步表明,通过充分的解析训练,以 OCR 为中心的理解监督为文档解析提供了额外的收益。主页:https://huggingface.co/spaces/SeerRay-Lab/Xiaomi-OCR-0.