论文
Infinity-Parser2技术报告
Infinity-Parser2 Technical Report
摘要
我们提出Infinity-Parser2:耦合可控数据合成管线与多任务强化学习、做端到端文档解析的大型多模态模型——解决忠实标注解析语料的持续稀缺。三项贡献:第一,构建可扩展的合成引擎(可控渲染框架配迭代精炼循环),构建并开源Infinity-Doc2-5M:500万样本的中英双语语料,跨多样文档类型,标注元素边界框、规范内容形式(Markdown、HTML、LaTeX、SMILES、结构化图表)与全页阅读顺序。第二,引入可验证的多任务奖励系统,实现跨八个共训目标(文档解析、版面分析、表格解析、数学公式、图表解析、化学公式、文档VQA与通用多模态理解)的联合强化学习——在单一优化信号中统一感知、结构与推理。第三,以共享架构发布两个变体:Infinity-Parser2-Flash优化低延迟推理(较Infinity-Parser-7B吞吐增益3.68倍)、Infinity-Parser2-Pro面向精度关键设定。Infinity-Parser2-Pro在olmOCR-Bench达最先进87.6%、ParseBench达74.3%——超过DeepSeek-OCR-2、PaddleOCR-VL-1.5与MinerU2.5,并在图表、化学公式与文档VQA上有强泛化。
