论文

斯坦福EDGAR文件数据集:把美国企业与财务披露重构为版式忠实、token高效的预训练数据

The Stanford EDGAR Filings Dataset: Reconstructing U.S. Corporate and Financial Disclosures into Layout-Faithful and Token-Efficient Pretraining Data

模型训练预训练

摘要

随着高质量公共网页语料日益枯竭——干净的长上下文文档已成为大语言模型(LLM)稀缺昂贵的训练数据源。既有长上下文语料常为专有且获取昂贵、合成生成——或集中于编程等狭窄领域。我们介绍斯坦福EDGAR文件数据集(SEFD)——把SEC文件开放重构为版式忠实的MultiMarkdown——用于金融语言建模与评估。SEFD使经审计的财务报表、风险披露、所有权报告、会计附注与影响市场的事件文件可用作长上下文预训练数据——以及金融推理、预测、合规与文档理解的基础。所得语料token高效、模型就绪——且与Common Crawl衍生语料的重叠低于0.1%。我们发布SEFD-v1——152B token的初始公开快照——并提供对更大1,850万文件档案(估计550B token)的语料级分析。我们进一步介绍两个SEFD衍生基准:EDGAR-Forecast——评估模型知识截止后基于文件的数值预测;EDGAR-OCR——评估复杂财务表格的转录。

斯坦福EDGAR文件数据集:把美国企业与财务披露重构为版式忠实、token高效的预训练数据:论文配图
图 2:碎片化的标头。归档代理将一个可视标题编码为行。浏览器保留分组 (a),而标准解析器将其分段 (b),SEFD 重建逻辑标头 (c)。