论文

解决金融数据缺失危机:用于 SEC 10-K 提取的生成式 AI 管道

Resolving the Missing Financial Data Crisis: A Generative AI Pipeline for SEC 10-K Extraction

应用与实践行业应用

摘要

SEC 10-K 文件包含大量财务信息,这些信息并未一致地在结构化数据集中捕获,从而造成数据缺失问题,影响了超过 70% 的公司和一半的总市值。这可能会使定量分析不成比例地偏向于规模较小的公司,而由于可用数据有限,这些公司可能被排除在外。传统的金融提取方法如正则表达式(Regex)和BERT已被广泛使用。然而,它们在解析复杂的 SEC 10-K 文件时非常脆弱,这会导致文件中存在的数据丢失,因为这些方法不考虑数据属性可能位于不同的部分或脚注中。本研究评估了多种大语言模型 (LLM),包括 Llama-3 8B、Qwen-2.5 14B 和 Llama-3.3 70B,以找出从 SEC 10-K 文本中提取特定属性时各个模型的优势和劣势。提取质量通过四个结构复杂性不同的金融变量进行评估:现金和现金等价物(表格)、短期债务(混合)、信贷便利(叙述)以及研究与开发(混合)。结果表明,虽然像 Llama-3 8B 这样的较小模型在复杂的负面提示下会出现性能下降,但将参数规模与文档复杂性保持一致可以产生较高的零样本精度。 Qwen-2.5 14B 作为表格专家表现出色,现金方面的 F1 得分为 83.33%,而 Llama-3.3 70B 有效地导航了密集的叙述性脚注,在研发方面取得了 76.92% 的 F1 得分。这一可扩展的框架解决了定量金融数据集中的关键信息缺口,并通过对 SEC 10-K 文件进行更彻底的分析来消除缺失数据偏差。