论文
LEDGER:基于企业年报的长上下文财务检索与提取基准
LEDGER: A Long-Context Benchmark of Corporate Annual Reports for Grounded Financial Retrieval and Extraction
摘要
财务报告是 大语言模型 的天然试验场,各种规模的最新模型的超长上下文功能使得该领域的严格评估变得越来越迫切。然而,大多数公共财政资源将任务简化为纯文本 SEC 10-K 文件以及一些问答项目。我们发布了 LEDGER(用于基于证据的提取和检索的文件的长上下文评估),这是一个包含 4,999 份数字化公司年度报告的语料库 - 包含数字、表格和叙述的完整文件,而不仅仅是监管文件。每份报告都标有 31 个可提取的综合财务关键绩效指标 (KPI),并将其与收益日的市场反应联系起来。从这些数据中,我们得出了三个跨越难度范围的评估基准:一个纯页面级 KPI 检索任务,对 118,048 个自然语言问题进行 TREC 风格的相关性判断,一个会话式“大海捞针”单值查找,以及一个完整的 KPI 提取任务,两者都来自冗长的、数字密集的报告。我们还提供具有注释者间协议的人类 OCR 质量注释以及完整的提取、验证和评分工具链。我们通过将首席执行官信函言论与出版后市场影响联系起来的案例研究,进一步证明了该数据集的研究效用。