论文

一个图像块就够:面向多模态大模型场景文本识别的强化优化视觉词元定位

One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

上下文与知识上下文工程

摘要

场景文本定位需要文本识别和空间定位之间的高精度对齐。虽然视觉词元定位已成为多模态 大语言模型 (MLLM) 的有前途的公式,但以前的多图像块范例经常引入冗余噪声和定位模糊性,特别是对于密集或小型文本实例。为了解决这个问题,我们提出了单补丁文本识别(SPaTS),这是一种以视觉为中心的框架,它通过单个锚视觉标记路由每个文本实例,然后通过全图像细化恢复几何形状。为了在没有预言标签的情况下准确识别该锚点,我们引入了单补丁选择性优化(SPaSO),这是一种强化学习框架,可使用补丁级奖励来优化离散视觉标记选择。为了进一步提高表示的鲁棒性和定位精度,我们引入了方向嵌入对齐(DEA),通过解耦特征幅度和方向来抑制不稳定的范数偏差,并引入补丁增强解码(PED),将路由锚点与语言语义融合,并交叉参与全图像特征图,以实现坐标空间代理之外的几何感知边界回归。大量实验表明,SPaTS 的性能始终显着优于前沿闭源 MLLM 和 OCR MLLM。代码可在 https://github.com/eeNickTang/SPaTS 获取。