论文

面向生成式 AI 的智能内容摄入与结构分块

Smart Content Ingestion for Generative AI Workloads

AI 基础设施数据基础设施

摘要

机器学习的发展逐渐改变了人工智能系统中智能的位置。在传统的机器学习中,任务、数据表示、标签和模型架构紧密耦合,因此数据准备范围很窄、受模式限制且可见。生成式人工智能将模型与任何单一任务解耦:一个基础模型服务于开放式下游任务,模型方面获得的通用性与数据方面的异构性相匹配,因为企业知识是以人们使用的格式(PDF、演示文稿、电子表格、扫描文档、表单、表格、图表和混合布局文件)编写的,这些格式同时携带文本、视觉、几何和结构信息。语言模型或检索器无法可靠地推理在此接口上歪曲的信息,因此内容提取本身就成为生命周期阶段,其错误没有下游检索器或重新排序器可以修复。本文提出了一种可用于生产的内容提取系统,使该阶段变得明确、可配置且可测量。该系统包含选择性 OCR 路由、稀缺性优先的管理引擎以及基于参考的提取评分器(可测量字符、单词和表格结构的准确性)、确定性结构感知的父子分块器以及只读检索评估器(可从每个页面生成接地问题并报告 Hit@k、平均倒数排名和延迟)。在 180 个文档语料库上,最佳提取器得分为 97.4(满分 100)(字符错误率 0.13%,表相似度 0.995),分块器在 25,050 个生成的问题上达到 hit@1 68.6%、hit@10 92.8% 和 MRR 0.77。我们提炼出三个设计原则(结构优先于语义、永远不要改变您的测量内容、预算您的标签)并将测量的内容提取定位为企业 Agentic 系统的感知层。