论文

表格问答的校准置信度估计

Calibrated Confidence Estimation for Tabular Question Answering

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 越来越多地用于表格问答,但结构化数据的校准在很大程度上尚未研究。本文首次对五个前沿 LLM 和两个表格 QA 基准的五种置信估计方法进行了系统比较。所有模型都严重过度自信(平滑 ECE 0.35-0.64 与文本 QA 报告的 0.10-0.15)。一致的自我评估与扰动二分法在两个基准和所有四个完全覆盖的模型中重复:自我评估方法(口头化,P(True))实现 AUROC 0.42-0.76,而扰动方法(语义熵、自一致性和我们的多格式协议)实现 AUROC 0.78-0.86。 Holm-Bonferroni 校正后,每模型配对引导测试拒绝 p<0.001 的零值,并且 GPT-4o-mini 上的 3 种子检查给出的每种子标准偏差仅为 0.006。该论文提出了多格式协议 (MFA),它利用结构化数据(Markdown、HTML、JSON、CSV)特有的无损和确定性序列化变化来估计置信度,API 成本比采样基线低 20%。 MFA 将 ECE 降低了 44-63%,概括了 TableBench 上的所有四个模型(平均 AUROC 0.80),并与采样相结合:MFA + 自洽集成将 AUROC 从 0.74 提升到 0.82。第二个贡献是结构感知重新校准,与标准事后方法相比,将 AUROC 提高了 10 个百分点。