论文
FinRCA-Bench:评测金融AI系统的证据检索与推理能力
FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI Systems
摘要
大语言模型越来越多地被用于支持金融业务,但其表面上的推理表现可能取决于是否拿到了正确的证据。在金融对账中,诊断所需的证据分布在发票、采购订单、审批、分摊、付款、账簿分录和银行流水之间,并通过交易关系而非文本相似性相互关联。因此,端到端准确率可能把证据获取与推理质量混为一谈。我们提出FinRCA-Bench,一个确定性的合成基准,包含2,250个应付账款到银行的对账案例,覆盖14张业务表,其中包括跨15个因果类别的1,500个注入故障,以及750个合法或困难负样本案例。根因标签和记录级证据契约对模型隐藏,从而可以独立于答案正确性来评估检索。我们比较了规则/SQL、经典机器学习、稠密语义检索、确定性关系扩展,以及类型化溯源图检索(Typed Provenance Graph Retrieval, TPGR)——一种仅限于持久化交易关系的类型化遍历。规则/SQL在留出集上达到84.97%的精确准确率,经典机器学习达到95.44%。在固定推理模型、提示与生成设置、仅更换检索的情况下,宏观必需记录召回率从0.83%提升到77.70%,16类精确准确率从2.05%提升到72.44%。在检索充分时,结构性检索失败以95比15多于推理失败;有254个预测在检索不完整的情况下仍然正确,而严格的返回证据契约准确率仅为5.72%。在FinRCA-Bench上,检索架构强烈塑造了AI系统所呈现的性能,而正确的根因标签只是可审计诊断的弱代理。