论文

ExtractConf:文档字段提取的多信号置信度评估

Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction

模型评测鲁棒性、公平性与可信度评测

摘要

财务核对、合规检查与采购自动化等文档流程中,未被发现的错误提取比明确缺失更危险。关键不只是准确率,还包括逐字段判断结果可自动处理还是需人工复核。词元对数概率、模型口述置信度和多次采样一致性在实际阈值下往往都判断为可靠,难以区分错误。ExtractConf通过同一文档的两种读取方式获取信号:字段导向Hunter按模式槽位提取,文档导向Mapper整体扫描并提取有原文依据的值。二者错误模式不同,前者可能为缺失字段生成值,后者可能漏掉视觉上不显著的字段,因此分歧具有独立信息。系统结合跨调用分歧、模型内部不确定性、OCR、图像质量及空间布局训练分类器,无需领域专用规则或针对每个领域重新训练。在55字段发票数据DocILE中,字段提取失败率为26%,ExtractConf的ROC AUC为0.928,比平均对数概率减少70%的选择性预测风险;保留80%结果时准确率99.1%。零样本迁移到CORD收据时AUC为0.858;轻量Lasso再校准将ECE降低89%、Brier得分降低43%,说明信号可跨文档领域使用。