论文

对复杂的多模式文档处理管道进行基准测试:企业人工智能的统一评估框架

Benchmarking Complex Multimodal Document Processing Pipelines: A Unified Evaluation Framework for Enterprise AI

模型评测基准与评测资源

摘要

如今,大多数企业文档 AI 都是一条管道。解析、索引、检索、生成。每个阶段都已经被自己研究得很彻底——仍然困难的是评估整个系统。我们构建了 EnterpriseDocBench 来尝试这一点:解析保真度、索引效率、检索相关性和生成基础性,所有这些都在同一个语料库上。该语料库是根据六个企业领域(当前试点中的五个领域)的公共、许可许可文档构建的。我们通过它运行了三个管道——BM25、密集嵌入和混合管道——所有管道都使用相同的 GPT-5 生成器。标题数字:混合检索以微弱优势击败 BM25(nDCG@5 为 0.92 对 0.91),并且两者都击败了密集嵌入(0.83)。幻觉并不随着文档长度单调增长——短文档和很长的文档都比中文档产生更多幻觉(28.1% 和 23.8% vs. 9.2%)。跨阶段相关性非常弱:解析->检索r=0.14,解析->生成r=0.17,检索->生成0.02。如果质量像我们大多数人想象的那样级联,那么这些数字会高得多;他们不是。设计注意事项是真实的(解析固定、生成器共享、自动代理指标),我们不会过度吹嘘结果。一个结果确实让我们感到惊讶:所陈述的事实准确性为 85.5%,但答案完整性平均为 0.40。当系统给出答案时,它是正确的——它只是遗漏了一些东西。对于实际部署来说,这种差距比总体准确度数字更重要。我们还描述了三种尚未端到端集成的参考架构(ColPali、ColQwen2、基于代理复杂性的路由)。框架、指标、基线和收集脚本将在接受后开源发布。