论文

TraRA:城市监控中视频文本识别的轨迹级识别聚合

TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance

模型推理推理验证与自校正

摘要

视频文本识别 (VTS) 对于城市监控和智能交通系统至关重要,可以自动读取视频流中的街道标志、车辆标记和场景文本。然而,由于监控场景中常见的动态视频因素(包括运动模糊、遮挡和尺度变化),可靠的识别仍然具有挑战性,这些因素会降低帧级识别的性能。现有的 VTS 方法通常对每个帧独立执行识别,导致序列之间的结果不一致且不准确。为了解决这些限制,我们提出了 TraRA(VTS 轨迹级识别聚合),这是一种即插即用的方法,通过利用时间和多模态一致性来执行轨迹级文本识别。 TraRA 集成了两个关键模块:(1) 时间聚类和 (2) 视觉语言聚合。前者通过对时间和视觉上连贯的文本实例进行分组来细化噪声轨迹,而后者则采用低秩适应增强的视觉语言模型将视觉线索与跨帧的语言上下文融合在一起。通过聚合整个文本轨迹的信息,即使在具有挑战性的监控条件下,TraRA 也能实现强大的文本识别。对四个公共基准(包括道路和城市场景数据集(RoadText、BOVText、ArTVideo 和 ICDAR15))的广泛实验表明,与最先进的 VTS 方法相比,TraRA 持续改进了跟踪和识别性能。源代码可在 https://github.com/trid2912/TraRA 获取。