论文

TextDS:分布变化下场景文本检测的参数高效表示对齐

TextDS: Parameter-Efficient Representation Alignment for Scene Text Detection under Distribution Shifts

模型训练参数高效训练

摘要

在现实世界的部署中,场景文本检测器不可避免地会面临超出训练分布的分布变化。先前的工作通常依赖于大规模场景文本预训练,但跨域变化和现实世界图像退化下的评估仍然有限。我们提出了 TextDS,一种用于分布变化下场景文本检测的有效框架。首先,我们提出了一种具有视觉基础模型的数据高效的双编码器设计,消除了对大规模场景文本预训练的依赖。其次,我们引入了逐步 LoRA 自适应(SWLoRA),它通过动态提前退出机制执行渐进的低秩细化,以实现有效的特征自适应。第三,我们提出公共子空间融合(CSF)来对齐和融合共享子空间中的两个分支,同时保留互补的、移位鲁棒的信息。最后,我们构建了不利条件场景文本检测数据集,以解决成像退化下评估的差距。实验表明,TextDS 在场景文本检测中实现了具有竞争力的性能,仅用 490 万个可训练参数就展示了跨领域和不利成像条件的鲁棒性。