论文
PolyOCR-Venus:用于以文本为中心的视觉智能的统一 OCR 基础模型
PolyOCR-Venus: Unified OCR Foundation Models for Text-Centric Visual Intelligence
摘要
光学字符识别 (OCR) 正在从纯文本转录向通用视觉智能发展,要求模型能够在复杂的视觉环境中识别、定位和推理文本信息。然而,现有的 OCR 系统通常只擅长某些任务,并且难以平衡跨场景的识别、解析和推理。在本报告中,我们介绍了 PolyOCR,这是一系列不同规模的统一 OCR 基础模型。 PolyOCR 将共享指令遵循框架与大规模数据引擎相结合,将异构视觉资源转换为经过质量验证的 OCR 监督。我们引入了能力引导的策略优化,它将基于验证者的组相对策略优化与通过基于教师可靠性和师生能力差距的样本路由的策略蒸馏相结合。我们还引入了 OCRBench v2.1,这是我们对 OCRBench v2 的修订版,具有手动验证的注释更正和任务对齐的评分指标。 OCRBench v2.1、CC-OCR、内部 KIE Benchmark、OmniDocBench v1.6 和 MDPBench 的大量实验表明,PolyOCR 实现了最先进或极具竞争力的性能。