论文

本地文档抽取的准确率与能耗取决于版式

The Right Information Extraction Pipeline Depends on the Document: Accuracy-Energy Trade-offs for Small, Local Models

模型评测评测方法与指标

摘要

信息提取管道是否应该处理页面图像或解析的文本取决于文档,并且答案在布局范围内翻转。我们在排除(封闭)云服务的约束下研究这种权衡:通过小型($\le 8\mathrm{B}$ 参数)纯文本和视觉语言模型在本地处理隐私敏感文档,在涵盖输入表示、模型系列和推理配置的设计空间上评估准确性和能量。对近乎纯文本的 Kleister-NDA 合同和布局丰富的 VRDU 表单进行基准测试,我们发现批处理是主要的能源杠杆,在不影响准确性的情况下将每页能源减少 38-85%,而一次处理一个请求时,FP8 量化可节省 27-32%,但一旦应用批处理,每页能源减少不到 1mWh (9-19%)。预处理占据主导地位:神经 OCR 每页的能量比传统 OCR 多花费 17 倍,而且永远不会达到帕累托边界。哪种表示方式获胜取决于文档类型:布局丰富的文档上的视觉语言模型和近乎纯文本的带有廉价解析器的小型纯文本模型,它们比任何视觉语言配置都更准确、更便宜。我们的工作为节能、符合隐私的本地信息提取提供了具体的指导方针。