论文

缩小文档 VLM 中的成本与质量差距:困难感知数据管理和质量调整部署经济学

Closing Cost-Quality Gap in Document VLMs: Difficulty-Aware Data Curation and Quality-Adjusted Deployment Economics

模型训练合成数据

摘要

在受监管的行业中,每年从数亿份文档中提取结构化字段的成本仍然很高:定制的 OCR 级联仅覆盖工作流程的一小部分,隐私规则排除了外部模型,并且现有的开源 VLM 明确了质量阈值,其服务成本比人工注释更高。我们提出了一个基于混合专家 VLM(总共 35B,3B 活动)构建的部署文档理解系统,对内部生产数据与由难度感知管道管理的开放域文档进行了微调,以实现布局多样性、事实可提取性和跨模型一致性。该模型安装在单个 H100 上并通过提示为异构工作流程提供服务,使所有可部署(非推理)基线提高了一个数量级。质量调整成本分析(通过生产遥测校准确认和校正成本)表明,与人类基线相比,其预期成本降低了 80% 以上,与最佳竞争开源模型相比,预期成本降低了 50% 以上,而较大的基线在经济上仍然不可行。