论文

TiTok:面向多事件时间定位的音视频大语言模型

TiTok: Audio-Visual LLM for Multi-Segment Temporal Grounding

应用与实践模型训练模型评测强化学习评测方法与指标通用理解与问答

摘要

未修剪视频中的视听多片段Grounding(AV-MSG)、对视听证据的推理以及预测查询的多个片段是一个基本问题,但仍然具有挑战性。仅视觉模型忽略了互补的声学线索,而视听模型通常无法校准事件的数量 - 我们将这种现象称为计数错误校准。 We present TiTok, an audio-visual large language model (AV-LLM) that localizes an arbitrary number of temporal event segments for each query.为了精确的边界预测,我们引入了时间Token交织(TTI)方法,该方法显式地将特殊时间Token注入到视听流中,以使输入侧时间感知与输出侧时间预测保持一致。我们进一步提出了用于强化学习的解耦、多段导向的奖励,包括全局、局部、计数、精度和格式奖励,并通过组奖励解耦标准化策略优化(GDPO)进行优化。为了评估 AV-MSG 的性能,我们建立了一个新的基于 UnAV-100 的评估协议,并提出了 CountF1 指标来量化重叠指标无法捕获的计数错误校准。 TiTok reaches 65.7 mIoU and 0.58 CountF1, achieving state-of-the-art performance.我们的代码可以通过此链接获得。

TiTok:面向多事件时间定位的音视频大语言模型:论文原图
图2:TiTok的整体流程。 (左)冷启动 SFT 阶段。 (右)基于 GDPO 的 RL 阶段,具有 TTI 和五个奖励。