论文
PaddleOCR-VL-1.6:通过欠优化区域细化和渐进式扩展文档解析的前沿 后训练
PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training
摘要
我们推出了 PaddleOCR-VL-1.6,这是一个基于 PaddleOCR-VL-1.5 构建的升级版紧凑文档解析模型。尽管 PaddleOCR-VL-1.5 建立了强大的 0.9B 基线,但其剩余错误集中在模型行为不稳定、数据覆盖稀疏或监督不可靠的欠优化区域。 PaddleOCR-VL-1.6并没有无差别地扩展训练语料库,而是引入了区域感知数据优化框架,该框架可以识别先前模型中的薄弱区域,对这些区域进行有针对性的增强,并提高监督信号的可靠性。它还采用了基于精选数据选择和强化学习的渐进式 后训练 配方,通过分阶段优化将模型性能推向更高水平。 PaddleOCR-VL-1.6 在 OmniDocBench v1.6 上取得了 96.33% 的最新分数,展现了与顶级 VLM 的强大竞争力,并为 PaddleOCR-VL 系列提供了实用的 后训练 配方。