论文

置信度值得信任吗?用于VLM文档提取的ConfBench

Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction

模型评测基准与评测资源

摘要

采用视觉语言模型(VLM)进行智能文档处理时,需要足够可靠的置信度分数,才能将信息提取结果分流至自动处理或人工审核。现有文档基准大多是干净、高质量的样本,低准确率区域样本稀少,难以评估校准效果。作者提出面向关键信息提取的置信度校准基准 ConfBench:对多样文档应用20种受控退化流程,得到1,346个文档变体和超过7万次实体级评估,覆盖完整的准确率范围。在三种输入形式下,评估四个闭源及三个开放权重VLM,并比较由模型直接给出置信度与基于对数概率的方法。结果显示:(1)OCR与图像结合时,置信度估计更准确;(2)模型能力是主要影响因素:Claude系列内部的置信度质量随能力单调提升,但跨系列比较时,参数量并不能很好预测置信度质量;(3)各模型的校准表现差异很大,既有接近完美的模型,也有严重过度自信的模型。逐模型的事后校正可重新缩放绝对置信度,以支持按阈值分流,但不会改变基于排序的运行指标;(4)采用首个词元聚合的对数概率方法,一贯优于平均词元与间隔聚合。作者还提出审核预算指标ECARB,将区分能力的提升转换为运行层面的节省,并公开ConfBench,支持可靠文档处理中的置信度估计与校准研究。

置信度值得信任吗?用于VLM文档提取的ConfBench:论文配图
图1:各文档实体抽取平均准确率的分布,即该文档所有实体级二元准确率的均值。(a) 原始数据集有75篇文档,主要集中在0.6以上,低准确率区域样本稀少。(b) 数据增强后,退化变体覆盖0.0至0.6区间,使得可以在完整准确率范围内评估校准情况。