论文
ET-SAM:SAM 中的高效点提示预测,用于统一场景文本检测和布局分析
ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis
摘要
先前基于分段任意模型(SAM)的工作在统一场景文本检测和布局分析方面取得了可喜的性能。然而,通常依赖像素级文本分割来采样数千个前景点作为提示,从而导致推理延迟不令人满意且数据利用率有限。为了解决上述问题,我们提出了 ET-SAM,这是一个具有两个解码器的高效框架,用于基于 SAM 的统一场景文本检测和布局分析。从技术上讲,我们定制了一个轻量级的点解码器,它可以生成单词热图来实现一些前景点,从而消除过多的点提示并加速推理。在不依赖像素级分割的情况下,我们进一步设计了一种联合训练策略,以利用具有异构文本级注释的现有数据。具体来说,具有多级、仅字级和仅行级注释的数据集并行组合为统一的训练集。对于这些数据集,我们在点解码器和分层掩码解码器中引入了三组相应的可学习任务提示,以减轻数据集之间的差异。大量实验表明,与之前基于 SAM 的架构相比,ET-SAM 实现了约 3$\times$ 的推理加速,同时在 HierText 上获得了有竞争力的性能,并在 Total-Text、CTW1500 和 ICDAR15 上平均提高了 11.0% 的 F 分数。