论文

图表和文档理解中金融视觉语言模型的置信度估计

Confidence Estimation for Financial Vision-Language Models in Chart and Document Understanding

模型评测鲁棒性、公平性与可信度评测

摘要

大型视觉语言模型越来越多地用于读取金融图表、表格与文档,但误读一个数字就可能改变决策,看似权威的回答也可能未使用图表。本文关注哪些回答可以直接采用、哪些应交给人工复核。在五个开放权重模型、三个金融视觉问答基准的四种条件(包括双语条件)下,研究比较七种置信度估计器:三种仅在推理时计算,四种为训练后的内部探针。所有探针仅在自然图像上训练,未针对金融适配,因此测量的是分布外迁移。结果表明,关键短板是校准而非排序:推理基线能较好地区分对错,却严重过度自信,只有训练后的探针能提供适于设置阈值的分数。可靠性随模型与任务变化,没有估计器在20种组合中领先超过8种;分模型检查后,原先看似稳定的双语表现实际来自模型组合方式。在限定错误率的人工复核策略下,可安全自动处理的比例首先受模型能力限制,置信度只能进一步缩小范围;最简单条件中可自动处理一定比例,最困难条件中几乎为零,严格5%错误预算下尤为明显。两种训练探针能实现所需校准,其中只有感知证据对齐的探针会对未使用图表的回答降低置信度,从而区分缺乏图表依据的回答与流畅猜测。