论文
FinSheet-Bench:从简单查表到复杂推理,LLM在财务电子表格上的失手之处
FinSheet-Bench: From Simple Lookups to Complex Reasoning, Where LLMs Break on Financial Spreadsheets
摘要
虽然大型语言模型(LLM)可以加速另类投资尽职调查中的文本密集任务,但它们在从复杂财务电子表格中准确提取和推理结构化表格数据方面的能力仍存在差距。进展受制于缺乏真实的行业基金组合数据集用于基准测试,因为私募股权数据室是保密的。为此,我们引入FinSheet-Bench,一个以真实私募股权基金结构为模型的合成财务组合数据基准,旨在评估LLM在文本序列化电子表格问答和数值推理任务上的表现。我们对来自OpenAI、Google和Anthropic的十个模型配置在财务电子表格——包括复杂布局、基金分隔线和多行列名——上的评估显示,没有任何单一模型达到足以在专业金融应用中无人监督使用的低错误率。表现最佳的模型Gemini 3.1 Pro在二十四个不同复杂度和结构布局的评估文件上取得82.4%的准确率(约每6题错1题),其后是带推理的GPT-5.2的80.4%、带思考的Claude Opus 4.6的80.2%以及Gemini 3 Pro的80.2%。性能在更大、更复杂的电子表格上大幅退化:最大的电子表格(152家公司、8只基金)在所有模型上的平均准确率仅为48.6%,而最简单的评估文件为86.2%。这些难度模式在十个模型上保持一致,表明它们反映的是LLM的局限而非特定模型的弱点。可靠的财务电子表格提取可能需要将文档理解与确定性计算分离的架构方法。
