论文

感知、布局与校验:金融文档自动放行的校准置信度

Perception, Layout, and Validation: Calibrated Confidence for Reliable Straight-Through Processing of Financial Documents

模型推理推理验证与自校正

摘要

对金融文档提取的键值字段进行无需人工审核的直通处理(STP),需要校准概率,以及对自动批准层残余错误的有界保证。现代视觉语言模型提供开箱即用的键值提取能力,但其口头表达的置信信号不可靠,与字段正确性的关联较弱。本文引入沿感知、布局和验证三个可解释通道分解的置信层,结合最终共形风险控制,使该分数可用于可靠的金融文档STP。我们使用Qwen3.6-27B与Gemini-3.1-Flash-Lite两个VLM家族,在覆盖真实发票、合成发票及广告采购表的三个公开数据集上验证。分解分数持续改善正确与错误提取的区分,AUROC从VLM口头信号的0.54—0.74显著提高至0.90—0.99,三个通道都有贡献。对工业部署更关键的是,这使STP达到可用水平:在目标错误率低于10%的风险控制下,原生VLM信心只能放行0.1%—7.0%的字段;所提方法可自动批准49%—72%的字段,同时将被接纳部分的实测错误率保持在目标以内。

感知、布局与校验:金融文档自动放行的校准置信度:论文配图
图1:端到端置信层。VLM先从页面图像提取未关联位置证据的字段,OCR片段补回定位,最近布局检索提供相似历史模板。感知、布局、验证三条可解释通道为各值打分,LightGBM融合为经校准的正确概率,再由共形选择门控决定是否自动批准,并在论文设定下将选择风险限制于α以内。