论文
财务报告中单个和多个表的文档级数值推理
Document-Level Numerical Reasoning across Single and Multiple Tables in Financial Reports
摘要
尽管 大语言模型 (LLM) 具有很强的语言理解能力,但它们仍然难以在长的结构化文档中进行可靠的问答 (QA),特别是在数字推理方面。财务年度报告体现了这一困难:财务报表分析通常取决于准确的算术,分析师通过整合分散在多个表格和叙述文本中的证据来得出关键指标。然而,现有的基准测试主要集中在单表设置上,而对跨表文档级数字推理的探索还不够。为了解决这一差距,我们引入了 FinLongDocQA,这是一个用于长上下文报告中的单表和跨表财务数值推理的数据集。在 FinLongDocQA 上评估闭源和开源 LLM 揭示了两个瓶颈:(1)年度报告通常超过 129k 个 token,加剧了定位相关表的上下文腐烂问题; (2) 即使找到了相关证据,LLM 在多步数值推理中仍然容易出错。我们提出了 FinLongDocAgent,这是一种多代理多轮检索增强生成 (RAG) 方法,可迭代检索证据、执行中间计算并验证各轮结果。实验强调了迭代检索和验证对于长财务文档中可靠的数值质量保证的重要性。