论文
运营化文档AI:面向生产环境OCR与LLM流水线的微服务架构
Operationalizing Document AI: A Microservice Architecture for OCR and LLM Pipelines in Production
摘要
学术研究往往聚焦于文档理解的新模型,导致文献在模型定义与生产规模运行模型之间存在巨大鸿沟。为弥合这一鸿沟,我们提出一种微服务架构,将分类、光学字符识别(OCR)与大语言模型(LLM)结构化字段抽取等多个模型封装为流水线,并分享了以每小时数千份多页文档的吞吐量运行该流水线的经验。我们阐述了主要设计决策,包括混合分类(hybrid classification)、将GPU密集型推理与CPU密集型编排相分离、对流水线中大量IO密集型操作采用异步处理,以及独立的水平扩展策略。通过批量性能剖析,我们得到了两项影响生产部署方式的惊人定性发现:主导端到端延迟的是OCR而非语言模型解析,且系统的饱和并发数由共享GPU推理容量而非工作进程数量决定。我们的目标是为从业者提供具体的架构模式,用于构建在基准之外同样有效的文档理解系统,从而在生产环境中切实实现模型的运营化。