论文
用于增强视听视频字幕的时间和跨模式对齐
Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning
摘要
虽然多模态 大语言模型 (MLLM) 具有先进的视频理解能力,但在视听视频字幕中实现精确的时间和跨模态对齐仍然是一项艰巨的挑战。大多数现有方法都存在模态分离和时间不连贯的问题,无法准确地将听觉事件与视觉实体绑定或捕获复杂的因果动态。为了解决这些缺陷,我们提出了 TCA-Captioner,这是一个专门设计用于增强视听视频字幕的时间和跨模态对齐的框架。我们首先介绍观察者-检查器-校正器 (OCC) 框架,这是一种迭代细化策略,可生成高保真、精心准备的训练数据。 TCA-Captioner 利用精心策划的高密度人类交互数据集,经过优化可以模拟复杂的视听交互。此外,我们还提出了 TCA-Bench,这是一种诊断基准,利用解耦评估协议来隔离和量化模型在视听绑定和时间关系推理方面的熟练程度。大量实验表明,TCA-Captioner 为时间连贯和同步的视听叙述设立了新标准。