论文
PereStruct:用于稳健历史文档解析的多模态语义组装
PereStruct: Multimodal Semantic Assembly for Robust Historical Document Parsing
摘要
解析具有复杂、非标准布局的历史文档仍然是大规模档案数字化的基本瓶颈。与现代印刷术不同,历史报纸表现出严重的物理退化和高度不规则的页面结构,甚至混淆了最先进的视觉语言模型,带来了严重的发行外挑战。我们通过专门为解析历史报纸和以特别复杂的多列布局为特征的文档而设计的自动化管道来解决这一差距。我们的方法结合了用于布局分析和块检测的微调 YOLO 架构(在 1,426 个完全人工注释的扫描页面上进行训练)和新颖的语义组装模块,该模块通过 TF-IDF 联合建模词汇语义相似性、来自微调 YOLO 的视觉嵌入以及几何布局约束来重建文章。这种多模式集成产生了最先进的性能,在块到文章映射上实现了 0.904 的 F1 分数。值得注意的是,针对视觉语言模型(Qwen3.6-35B-A3B 和 Qwen3.6-Plus)的端到端评估表明,PereStruct 实现了更高的保真度(BLEU 约为 0.96 vs 0.34),验证了模块化架构在通用 VLM 在复杂历史布局上失败的情况下表现出色。为了支持该领域的可重复性和推进研究,我们发布了包含 599 个带注释页面的训练语料库和包含 93 个页面的精心策划的 PereStruct 基准测试,其中包含经过专家验证的 真值 块到文章的映射。该框架为复杂档案材料的高保真数字化和语义重建奠定了坚实的基础。