论文
使用细粒度分类法从 SEC 8-K 文件中提取有原文证据的事件
Grounded Event Extraction from SEC 8-K Filings with a Fine-Grained Taxonomy
摘要
8-K 表格备案是美国上市公司披露重大事件的主要渠道,但附加的 SEC 项目代码很粗糙:单个项目涵盖例行行政变动和首席执行官离职,许多对市场影响最大的披露都属于包罗万象的项目。 大语言模型 使细粒度标签在语料库规模上变得可行,但前提是标签可以追溯到源文本并证明是可靠的。我们提出了一个两阶段系统,根据 119 种事件类型的三层分类法标记 8-K 披露。第一阶段将输出限制为有效的分类条目,并通过模糊 n 元语法验证将每个标签锚定为逐字引用;第二个根据类别定义对每个引用的引文重新进行评分,以产生质量分数。将该系统应用于 2022 年至 2026 年的 292,984 份申请,产生了我们发布的 601,088 个有原文证据的事件标签。在超过 5,125 个分层标签中,LLM 法官发现精度随着质量得分单调上升,从 12% 上升到 96%,而不受支持的标签从 8% 下降到接近零。 Ablation 显示仅在专用的第二遍中分配时才对分数进行校准。对未签名异常收益的事件研究证实,在没有任何语言模型的情况下,分类法将共享项目代码的经济上不同的事件分开。