论文
MEVL-STP:用于任意形状场景文本识别的多编码器和视觉语言模型
MEVL-STP: Multi-Encoder and Vision Language Model for Arbitrarily Shaped Scene Text Spotting
摘要
对于任意形状的文本实例(例如自然图像中的弯曲标志和密集的多方向字符),场景文本识别仍然具有挑战性,其中紧密耦合的架构将定位错误直接传播到识别失败。我们提出了一个两阶段的管道,将多编码器分割与视觉语言模型识别相结合来解决这个问题。在检测阶段,六个冻结视觉编码器(CLIP、DINOv2、SigLIP、EVA-CLIP、SAM 和 ConvNeXt)提取跨越语义、空间和纹理光谱的互补特征,这些特征通过具有通道注意力的可训练分层特征金字塔网络进行融合,并通过深度监督渐进尺度扩展网络进行解码,以生成精确的实例级文本掩码。通过保持编码器冻结,它们独立学习的特征空间在融合过程中保持正交,防止特征同质化降低单主干检测器的边界精度。检测阶段生成紧密的多边形掩模,这些掩模符合弯曲和任意方向文本的实际形状,而不是不可避免地包含背景内容的轴对齐矩形。在识别阶段,这些多边形遮罩裁剪将目标文本与周围的杂乱隔离开来,允许 Qwen3-VL-8B-Instruct 模型通过对多边形裁剪场景文本的低秩适应进行微调,完全专注于阅读文本,而不受相邻单词或背景噪声的干扰。在没有任何合成预训练数据的情况下,我们的方法在 CTW1500 上实现了 91.99% 的检测 F 测量和 85.86% 的端到端 H 均值,创下了新的技术水平,并且在没有任何合成训练数据的情况下在 Total-Text 和 ICDAR 2015 上实现了强大的性能。代码可在此 https URL 获取