论文
TimeLens2:多模态大模型通用视频时序定位
TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs
摘要
视频多模态 大语言模型 (MLLM) 可以描述视频中发生的情况,但很少识别支持证据何时出现。我们研究通用视频时间基础,其中一个模型预测跨视频长度、领域、查询形式和观点的一组可变基数证据区间。现有的训练策略与这种集值任务不一致:长视频标签通常依赖于脆弱的一次性注释,而强化学习奖励要么无法区分非重叠预测,要么需要脆弱的片段匹配。 TimeLens2 将时间证据视为整个监督和优化过程中设置的间隔。 TimeLens2-93K 通过字幕衍生提案、独立定位、跨智能体共识、语义验证和边界细化构建可靠的多跨度监督。我们的时间 Wasserstein 奖励计算合并区间支持上均匀分布之间的精确一维 \(W_1\),在不等基数和等效碎片下提供密集、无匹配的反馈;时间 IoU 通过精确的重叠反馈对其进行补充。在七个基准测试中,TimeLens2-2B 在每个基准测试中都优于所有尺寸匹配的基准,而 4B 和 8B 变体则实现了最先进的性能,超越了具有高达 397B 参数的开源模型。 2B、4B 和 8B 变体比 Qwen3-VL 主链分别提高了 14.2、13.0 和 18.1 mIoU 点。