场景文本识别能读懂稀有作文吗?
Can Scene Text Recognition Read Rare Compositions?
摘要
据报道,场景文本识别在六个标准基准上的准确率为 89--97%,并且该问题被广泛视为已饱和。我们提供另一种解读。当相同的测试图像根据参考语料库按 真值 单词稀有度和字符 n-gram 新颖性联合分层时,结果 5x5 网格的稀有词 x 稀有三元组角的准确度在 9 个英语专业识别器中比 q3/q3 中心下降 10--18 pt,并且相同的方向(中心下方的角)适用于我们在四个测试中测试的 13 个(语言、模型)对中的所有 13 个。书写系统(拉丁语、汉语、汉语+假名、阿拉伯语)。下降并不是产能瓶颈。 6 倍视觉主干放大(CLIP4STR-Base 158M -> CLIP4STR-Huge 1.0B、OpenCLIP ViT-H/14 LAION-2B)在总体精度方面领先于每个基准,但应力角保持不变(86.9 -> 86.5,在配对引导噪声内)。四个聚合探针——逐层探测、错误时置信度、注意力重新平衡和跨脚本提交与弃权错误分割——将失败定位到自回归解码器的词汇先验。然后我们询问现有技术可以弥补多少差距。在 16 个非架构缓解措施中,最大的平均 q5/q5 增益为 +1.3 pt,并且没有一个可以清除配对自举本底噪声;唯一有效的干预措施是从自回归到 CTC 解码的架构转变(SVTRv2,+2.5 pt,p=0.02,n=474)。置信度路由的 AR-CTC 集成增加了方向一致的 +0.6 pt,保持在噪声范围内,其主要学习系数是每个模型自己的最小 softmax 置信度 - 独立呼应上述机制。我们测试的任何配置都无法同时提高组合角点和聚合精度。因此,稀有输入长尾表明架构发生变化,而不是增加容量。