论文

超越 OCR 准确性:模块化和端到端的图像降级下以文本为中心的 VQA

Beyond OCR Accuracy: Text-Centric VQA Under Image Degradation with Modular and End-to-End

模型评测鲁棒性、公平性与可信度评测

摘要

以文本为中心的视觉问答 (VQA) 需要对图像中嵌入的文本进行读取和推理,当图像遭受现实世界的退化(例如运动模糊、低分辨率或压缩伪影)时,这项任务会变得更加困难。虽然基于 OCR 的模块化管道和端到端视觉语言模型都广泛用于此任务,但它们在退化条件下的相对鲁棒性仍未得到充分探索。我们提出了一项实证研究,将两个模块化管道与 SA-DBNet 进行比较,SA-DBNet 是一种自定义检测器架构,将 ResNet-18 与自注意力空间建模和可变形卷积与端到端视觉语言基线相结合,并在 4013 个退化图像和 7000 个问答对上进行了评估。经过微调的模块化管道可实现高达 57.50% 的精确匹配精度,而端到端基线的精确匹配精度为 38.00%,而特定领域的微调可实现高达 29.50 个百分点的增益。重要的是,我们发现字符错误率和单词错误率等传统 OCR 错误指标对于下游 VQA 性能的预测并不可靠,因为语义推理可以在存在上下文提示时弥补识别失败。这些发现强调了在现实视觉条件下对以文本为中心的 VQA 系统进行任务感知评估的重要性。代码可以在这里找到