FireRed-OCR 开源:Qwen3-VL-2B 上以三阶段渐进式优化达成 OmniDocBench v1.5 端到端 SOTA(综合 92.94%)
FireRed-OCR 开源发布:端到端方案新SOTA!小红书提出低成本文档识别训练范式
概述
FireRed-OCR 针对通用 VLM 处理复杂文档时的「结构性幻觉」(懂意图但输出 Markdown 表格错乱行列、凭空创造语法),提出 Pre-alignment → Specialized SFT → Format-Constrained GRPO 的三阶段渐进优化:Stage 1 多任务 OCR 预对齐并行学习检测框列举及 OCR、指定区域 OCR、全图 OCR,把模型关注点从通用图文理解迁移到文本定位+内容识别+结构表达并建立像素级空间坐标感;Stage 2 聚焦全图 Markdown 专项监督微调,强化跨语种、复杂布局下的结构一致性与层级表达稳定性;Stage 3 用 GRPO 强化学习约束公式语法合法性、层级结构闭合性、表格结构完整性与文字内容准确性,赋予自我纠错能力。榜单结果为 OmniDocBench v1.5 端到端模型首位:综合评分 92.94%(唯一突破 92% 的端到端模型,优于第二名 DeepSeek-OCR 2 的 91.09%,较 Qwen3-VL-2B 提高 11.07 分),文本识别 96.8%,公式解析 CDM 91.71%,表格重构 TEDs 90.31%,阅读顺序 95.9%。模型权重经 HuggingFace 与 ModelScope 开放,并提供 HF/ModelScope Demo 在线体验。 流水线由五大步骤构成,且绝大多数环节由开源模型构成以压低数据生产成本:一是几何特征驱动与多维 Tag 体系,用传统图像编码器提取文档几何结构特征聚类以识别结构重叠、稀缺版式与冗余数据,并构建含语种、页面布局、文档来源、文体类型(论文/发票/合同等)的标签体系使数据分布可解释可调控;二是均衡采样与统一重标注,分层均衡采样后用 PaddleOCR-VL 对所有数据做统一风格 Markdown 重标注,消除来源间标注风格冲突;三是稀缺数据合成,基于 HTML 母本的图像渲染合成链路人工补齐分布缺口;四是自动化质量控制与难样例沉淀,检测 Markdown 层级闭合、表格完整性与重复乱码,再用大模型做内容审核,把不合格样本二分,明显无效丢弃、高难错题纳入 Hard Case 库;五是专家级修正,引入 Gemini 3.0 Pro 等外部高精度模型对少量 Hard Case 辅助标注修正以提升复杂页面 GT 精度。