论文
感知、布局与校验:金融文档自动放行的校准置信度
Perception, Layout, and Validation: Calibrated Confidence for Reliable Straight-Through Processing of Financial Documents
摘要
对金融文档提取的键值字段进行无需人工审核的直通处理(STP),需要校准概率,以及对自动批准层残余错误的有界保证。现代视觉语言模型提供开箱即用的键值提取能力,但其口头表达的置信信号不可靠,与字段正确性的关联较弱。本文引入沿感知、布局和验证三个可解释通道分解的置信层,结合最终共形风险控制,使该分数可用于可靠的金融文档STP。我们使用Qwen3.6-27B与Gemini-3.1-Flash-Lite两个VLM家族,在覆盖真实发票、合成发票及广告采购表的三个公开数据集上验证。分解分数持续改善正确与错误提取的区分,AUROC从VLM口头信号的0.54—0.74显著提高至0.90—0.99,三个通道都有贡献。对工业部署更关键的是,这使STP达到可用水平:在目标错误率低于10%的风险控制下,原生VLM信心只能放行0.1%—7.0%的字段;所提方法可自动批准49%—72%的字段,同时将被接纳部分的实测错误率保持在目标以内。
