论文
FinGround:通过原子论断验证检测并定位金融幻觉
FinGround: Detecting and Grounding Financial Hallucinations via Atomic Claim Verification
摘要
金融AI系统必须产出有特定监管文件依据的回答,但当前的LLM会编造指标、虚构引用并算错派生量。随着欧盟AI法案高风险执行期限(2026年8月)的临近,这些错误带来直接的监管后果。现有幻觉检测器对所有论断一视同仁,漏掉了43%需要对结构化表格进行算术复核的计算错误。我们提出FinGround,一个面向金融文档问答的三阶段"先验证后扎根"管线。阶段1在文本与表格上执行金融感知的混合检索。阶段2将答案分解为原子论断,按六类金融分类法分类,并用包括公式重建在内的按类型路由策略加以验证。阶段3改写无依据的论断,并附上段落级与表格单元格级的引用。为了干净地将验证价值与检索质量解耦,我们提出检索均等化评估(retrieval-equalized evaluation)作为RAG验证研究的标准方法论:当所有系统获得相同检索时,FinGround仍将幻觉率较最强基线降低68%(p < 0.01)。完整管线相对GPT-4o实现78%的降低。一个8B蒸馏检测器在单论断延迟低18倍的情况下保留91.4%的F1,实现每查询0.003美元的部署成本,并得到为期四周的分析师试用的定性信号支持。