论文
LLM 的财务推理可信吗?对长期陈述的现实测试
Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements
摘要
大语言模型(LLM)是否具有真正的结构推理,或者仅仅依赖于表面级模式匹配?金融领域需要长期上下文中的数值精度和多步骤逻辑,是一个理想的测试平台。现有的基准无法捕捉现实世界的工业复杂性,主要依赖于多项选择问题或对裁剪表的单跳 QA,而忽略了复杂的跨语句动态和时间累积。为了弥补这一差距,我们引入了 FinIndices,这是一个大规模基准,用于评估未经裁剪的财务报表(最多 32K 词元)的数据处理保真度。 FinIndices 利用带有对抗性陷阱的自动合成管道,包含单索引计算和表索引制表来测试复杂的域、时间和口径推理。我们的评估揭示了两个严重的 LLM 漏洞。首先,“知识瓶颈”:尽管在 预训练 期间记住了公式,但模型表现出脆弱的模式匹配。删除显式公式提示会导致性能崩溃(例如,Gemini-3.1-Pro 在表任务上从 70.70% 下降到 38.22%),暴露出时间累积和库存流口径不匹配的致命缺陷。其次,“结构瓶颈”:生成多度量、多周期表的强烈认知负荷会主动消耗推理能力。在结构压力下,完美地执行孤立推导的 LLM 回归到浅层启发式,例如获取不正确的相邻列或用惰性文字算术替换深度会计调整。最后,受监督的 微调 (SFT) 产生了可观的零提示增益(+8.54% Single,+3.82% Table),验证了可以通过以数据为中心的对齐来部分恢复结构化逻辑。