论文

ReViCo:通过纠错揭示 VLM 在视觉文本理解中的局限性

ReViCo: Unveiling the Limitations of VLMs in Visual Text Understanding via Error Correction

模型评测基准与评测资源

摘要

视觉语言模型(VLM)在一般视觉任务中取得了巨大成功,但它们仍然难以深入理解图像中的文本。在本文中,我们介绍了 ReViCo(真实视觉校正),这是一个旨在通过视觉文本纠错的新颖任务来评估 VLM 文本理解的基准。 ReViCo 挑战模型来识别和修复现实世界图像中的文本错误,这需要对视觉文本与其周围视觉上下文之间的相互作用有深刻的理解。我们使用两种不同的范式对各种 VLM 进行基准测试:基于提示的策略和有针对性的 模型训练,两者都旨在突破当前模型的极限。我们的实验表明,即使是最好的 VLM 与人类之间也存在显着的性能差距,进一步的分析还表明,大多数模型都难以准确感知视觉文本,从而导致频繁的校正错误。通过强调这些差距,ReViCo 为开发更强大的文本感知 VLM 提供了新的基准基础。