论文

FinRule-Bench:金融表格与会计原则联合推理基准

FinRule-Bench: A Benchmark for Joint Reasoning over Financial Tables and Principles

模型评测基准与评测资源

摘要

大语言模型(LLM)越来越多地应用于金融分析,但其在显式会计原则下审计结构化财务报表的能力仍少有探究。现有基准主要评估问答、数值推理或对合成污染数据的异常检测,模型能否在正确财务报表上可靠地核验或定位规则合规尚不清楚。我们提出FinRule-Bench——评估真实财务报表上基于规则的金融推理诊断完备性的基准。FinRule-Bench把真值财务报表与显式、人工精编的会计原则配对,覆盖四类经典报表:资产负债表、现金流量表、利润表与权益变动表。基准定义三个需要递进推理能力的审计任务:(i)规则核验:测试对单一原则的合规;(ii)规则识别:需从给定规则集中选出被违反的原则;(iii)联合规则诊断:需在记录级检测并定位多处同时违规。我们在零样本与少样本提示下评估LLM,并引入因果-反事实推理协议,强制决策、解释与反事实判断之间的一致性。跨任务与报表类型,我们发现模型在孤立规则核验上表现良好,但在规则判别与多违规诊断上急剧退化。FinRule-Bench为研究LLM在高风险金融分析中的规则治理推理、诊断覆盖与失败模式提供了有原则、可复现的测试床。

FinRule-Bench:金融表格与会计原则联合推理基准:论文配图
图1:FinRule-Bench基准概览:在明确会计规则下评估LLM的表内推理与跨多张财务报表的联合推理等财务审计能力。