论文
ClearText-Video:以文本为中心的大规模视频数据集,桥接视频恢复和场景文本增强
ClearText-Video: A Large-Scale Text-Centric Video Dataset Bridging Video Restoration and Scene-Text Enhancement
摘要
多模态 大语言模型 (MLLM) 最近在视觉语言理解方面取得了巨大进展。然而,它们在以文本为中心的视频推理上的性能仍然对输入质量高度敏感。现实世界中用户提供的视频通常包含运动模糊、压缩伪影、噪声和低分辨率文本,这会损害可靠的文本阅读和下游推理。 MLLM 是否能够在不同质量条件下稳健地读取和推理现实世界场景文本仍然是一个基本的悬而未决的问题。我们引入了 ClearText-Video (CTVid),这是一种大规模的场景文本感知基准,用于研究受控质量变化下以文本为中心的视频理解。 CTVid 包含 4,639 个真实世界的文本丰富的自我中心视频、55 万多个帧、160 万个经过人工验证的场景文本注释以及 22 万个中英文空间/时间问答对。对于每个高质量视频,CTVid 提供内容匹配的降级质量和恢复质量变体,支持两个任务系列:以文本为中心的视频恢复和多质量视频QA。我们在 CTVid 上评估了 18 种代表性恢复方法和 16 种最先进的 MLLM。结果表明,视觉增强并不能保证文本保真度或下游推理增益:模糊比低分辨率更具破坏性,恢复的视频可以改变 MLLM 使用的文本证据,并且仅 OCR 管道仍然远远低于直接多模态推理。 CTVid 揭示了视频恢复和基于文本的理解之间的差距,为恢复感知、质量稳健的以文本为中心的视频系统提供了严格的基础。