论文
IPO-Mine:用于长、多模式 IPO 文件的分段结构分析的工具包和数据集
IPO-Mine: A Toolkit and Dataset for Section-Structured Analysis of Long, Multimodal IPO Documents
摘要
首次公开募股 (IPO) 备案是私人公司上市时发布的文件,允许个人(散户)投资者购买其股票。这些文件描述了公司的业务、财务和风险,是带有叙述性文本和图像的长篇多模式文档。尽管IPO申请对金融市场很重要,但目前还没有大规模、标准化的数据集或基准来使用现代语言和多模式模型来研究IPO申请。这些文件带来了重大挑战:申请数量经常超过 500,000 个词元,并且缺乏一致的结构组织。我们介绍 IPO-Toolkit,这是一个开源框架,用于下载 IPO 申请并将其解析为标准化的节结构文本和提取的图像。该工具包可对文件进行分段、提取嵌入图像并生成结构化输出,从而能够对长的多模式文档进行大规模、可重复的分析工作流程。利用这一基础设施,我们构建了 IPO 数据集,这是一个大型、分段结构、多模式数据集,涵盖 1994 年至 2026 年超过 109,000 份 IPO 申请和修订,包含超过 76,000 张图像。我们对提取的财务图表建立结构化评估任务,包括图表质量和误导性评估。我们的实验表明,最先进的多模态模型通常与人类专家对这些任务的判断存在偏差,暴露了长篇现实世界监管文件中多模态推理的对齐挑战。除了基准测试之外,IPO 数据集还可以对部分级别的文本变化以及视觉和文本披露实践中的跨行业差异进行大规模分析。我们的代码、数据集和网站在 CC-BY-4.0 下公开可用。