论文

结构化输出基准:用于评估 大语言模型 中结构化输出质量的多源基准

The Structured Output Benchmark: A Multi-Source Benchmark for Evaluating Structured Output Quality in Large Language Models

模型评测基准与评测资源

摘要

大语言模型 越来越多地被部署来从非结构化和半结构化来源提取结构化数据:解析发票、医疗记录以及将 PDF 文档转换为数据库条目。然而,结构化输出生成的现有基准要么仅关注模式合规性,要么评估单个源域内的值正确性。我们引入 SOB(结构化输出基准),这是一个涵盖三种源模式的多源基准:原生文本、图像和音频对话。无论源模态如何,所有模型都会接收其上下文的文本规范化表示;这种深思熟虑的设计将结构化输出能力与原始视觉或语音处理质量隔离开来,确保公平、与来源无关的比较。我们的基准包括从 25,091 条记录的完整语料库中提取的多跳 QA 得出的 5,000 条文本评估记录、来自 OCR 处理的 PDF 的 209 条图像记录,涵盖七种文档类型,包括多列布局、密集表格、扫描的历史文档、小字体文本和数学排版,以及来自 AMI 语料库的 115 条音频记录。每条记录将一个自然语言问题与模型必须遵循的 JSON 模式以及根据源上下文验证的 真值 答案配对。我们评估了跨三个源域和七个指标的 21 个前沿和开放权重模型。我们的结果揭示了一个一致的模式:模型实现了近乎完美的模式合规性,但通过精确的叶值匹配来衡量的最佳值准确度在文本上仅达到 83.0%,在图像上达到 67.2%,在音频上达到 23.7%,其中较长的上下文使得提取变得更加困难。我们发布了数据集、评估管道和所有相关代码。