模型

Xiaomi-OCR-0开放0.8B视觉语言模型,统一文档解析与OCR问答

Xiaomi-OCR-0

应用与实践通用理解与问答视觉感知与空间理解

概述

SeerRay-Lab公开Xiaomi-OCR-0权重和完整模型说明,模型为0.8B OCR专用视觉语言模型,基于Qwen3.5-0.8B-Base,采用约1.7亿样本的OCR相关语料。训练依次进行Q-Mask文字位置锚定、OCR持续预训练和具有可核验奖励的混合任务强化学习。它同时覆盖文档解析、OCR相关视觉问答及关键信息抽取,原文提供解析和结构化抽取提示、推理代码与Apache 2.0许可。数据构建包含异构专家共识、渲染验证和困难样本定向合成。模型卡中的OmniDocBench等结果为开发方报告,扫描、变形和拍照文件的鲁棒性仍需按实际材料复测。本条按带完整权重与说明的原始提交日期归档;publisher采用仓库所有者SeerRay-Lab,没有仅凭Xiaomi名称声称小米集团已确认发布。