论文
StrucTab:表解析的结构化优化框架
StrucTab: A Structured Optimization Framework for Table Parsing
摘要
表解析旨在将表图像转换为结构化的机器可读表示,这是一项需要复杂空间布局和文本内容联合感知的任务。虽然最近的视觉语言模型(VLM)支持端到端解析,但它们通常依赖于对最终输出的直接监督,从而绕过了对于理解复杂表结构至关重要的显式中间推理。此外,使用强化学习(RL)优化这些模型的尝试通常会受到不稳定或模糊的奖励设计的阻碍,从而限制了潜在的性能提升。为了解决这些限制,我们提出了 StrucTab,一种通过中间结构监督和奖励分解学习的表解析模型。在建模层面,通过将解析过程分解为受人类启发的子任务,例如行列计数和合并单元分析,StrucTab 通过顺序推理策略逐步统一它们。在优化层面,我们引入了 Uni-TabRL,这是一个统一的 RL 框架,它利用分解的奖励(有效性、结构和内容)来提供稳定且信息丰富的优化信号。最后,在评估层面,我们提出了 TableVerse-5K,这是一个大规模的、具有挑战性的基准,涵盖了各种真实的桌面场景。大量实验证明了 StrucTab 在所有评估的公共基准中的最先进性能以及 TableVerse-5K 上的显着改进,验证了显式结构建模和分解奖励优化的有效性。代码和基准可在 https://github.com/VirtualLUOUCAS/StrucTab 上公开获取。