HunyuanOCR-1.5:让轻量级 OCR VLM 更快更好
HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
摘要
我们推出了 HunyuanOCR-1.5,一个轻量级的端到端 OCR 专用视觉语言模型。 HunyuanOCR 将文档解析、文本识别、信息提取、文本图像翻译和多图像文档理解统一在单个端到端 VLM 中。 HunyuanOCR-1.5在HunyuanOCR-1.0的轻量级架构基础上,没有重新设计骨干网,而是系统性地提升了效率和能力。为了提高效率,我们使 DFlash 适应 OCR 解码,显着减少长结构化输出(例如密集文档、表格和公式)的延迟,同时保留输出分布。在 DFlash 的支持下,HunyuanOCR-1.5 实现了 6.37 倍的 Transformer 推理加速,在 vLLM 下实现了 2.14 倍的加速,在轻量级 OCR VLM 中提供最快的推理。对于能力,我们提出了 Agentic Data Flow,这是一种代理驱动的数据构建系统,可将模型缺陷转化为可执行的数据需求,并自主执行材料搜索、质量验证和管道开发。它大幅提升了古文字OCR、细粒度图表和表格解析、以多图像文本为中心的QA、低资源多语言解析和文档幻觉评估等方面的长尾能力。 HunyuanOCR-1.5 在 OmniDocBench v1.6 上跻身顶级端到端 OCR 解决方案之列,同时在这些长尾任务中实现了新的性能里程碑。结合升级的预训练和后训练配方,HunyuanOCR-1.5进一步扩展了其在高分辨率、长上下文和多任务场景下的能力。实验证明了更快的推理、更广泛的 OCR 能力覆盖范围以及轻量级端到端模型的部署优势。我们将发布模型权重和训练代码以支持未来的研究和现实世界的 OCR 应用。