论文

从像素到对:噪声文档环境中基于 LLM 的键值提取的综合基准

From Pixels to Pairs: A Comprehensive Benchmark of LLM-Based Key-Value Extraction in Noisy Document Settings

模型评测鲁棒性、公平性与可信度评测

摘要

大型语言模型 (LLM) 越来越多地用于从文档中提取结构化信息,但它们在现实 OCR 噪声下的行为仍然知之甚少。我们提出了开源指令调整的 LLM 的系统基准,用于在纯文本和嘈杂的 OCR 条件下进行键值对 (KVP) 提取。我们使用 Gold-text 注释和 PaddleOCR、EasyOCR 和 Tesseract 的 OCR 输出在 FUNSD、CORD 和 SROIE 基准上评估代表性的仅解码器模型(Gemma、Mistral、Qwen2.5、LLaMA 3 和 DeepSeek)。统一的评估协议可以在一致的条件下隔离输入质量、模型设计和提示的影响。结果表明,当高质量文本可用时,现代大语言模型可以充当强大的语义提取器,在某些情况下接近受监督的布局感知系统。然而,在 OCR 噪声下,随着输入损坏的增加,性能会大幅下降,并且模型之间的性能差距会缩小。在所有数据集中,提取性能由两个因素决定:文本语义推理和 OCR 噪声下文本保真度的保留。虽然较大的模型可以改善干净文本的结果,但这些收益在嘈杂的输入下会减弱,其中 OCR 质量成为主导因素。我们还识别重复出现的故障模式,包括键值错位、幻觉和数字损坏。我们的研究结果强调了纯文本评估与实际部署之间的差距,强调需要共同提高 OCR 质量、结构推理和基于 LLM 的语义建模。