论文
FinVerBench:大语言模型财务报表验证中的基准效度与校准
FinVerBench: Benchmark Validity and Calibration in Large Language Model Financial Statement Verification
摘要
我们提出FinVerBench,一个面向财务报表验证的基准与效度研究:判断一组公司财务报表在呈现给模型的信息范围内是否数值一致。FinVerBench基于43家标普500公司的SEC 10-K XBRL申报文件构建,定义了涵盖算术、跨报表勾稽、同比和数量级扰动四类错误的错误分类体系。我们尝试了15个当代LLM评估并报告14次完整运行;一次Gemini 2.5 Pro运行因40/108个网关调用失败而被排除在主要对比之外。所有二值指标均排除因扰动科目未被渲染而欠定的正例实例,留下105个实例的可观测诊断子集(43个干净样本、62个注入错误的样本)。在未取整诊断子集上使用原始引导式清单提示时,14次完整LLM运行中有9次对干净报表产生95-100%的误报,而有一次运行实现了0%的观测误报。基准的渲染选择会实质影响所测得的召回率:在同一可观测子集的现实取整变体上,经校准模型的召回率为79.0%、观测误报率(FPR)为0%,而在未取整诊断变体上召回率为100.0%。这些结果支持的是一个构念效度结论而非最终排行榜:财务报表验证不只是算术检测,而是在不完全可观测性、提示诱发的假设和现实数值渲染之下的校准判断。FinVerBench与全部代码均已公开。
