论文
视听 Flamingo:针对长且复杂的视频的开放视听智能
Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
摘要
我们推出了视听 Flamingo (AV-Flamingo),这是一种完全开放的最先进的视听 大语言模型 (AV-LLM),用于对音频、图像和长视频进行联合理解和推理。与之前主要关注短片的 AV-LLM 不同,AV-Flamingo 专为理解和推理长而复杂的现实世界(视听)视频而设计。为了支持这一点,我们做出了三项关键贡献:(i) Audio-Visual-Skills,一个大规模的真实世界视频集合,包含约 700 万条描述和问答训练实例,旨在强调时间、组合和跨模式视听推理; (ii) 新颖的三阶段课程,逐步训练从短程感知到长程多事件推理的模型; (iii) 时间视听交错思维链,一种推理框架,明确地将中间推理步骤基于长视听流中的时间戳,从而改善时间对齐和可解释性。超过 15 个视听、全模态、音频和视觉基准的广泛实验表明,AV-Flamingo 的性能明显优于类似大小的开放模型,并且与更大的开放权重和封闭模型保持高度竞争,甚至在某些情况下超越,特别是在长期且复杂的现实世界视听理解和推理任务上。除了基准性能之外,AV-Flamingo 还表现出强大的现实实用性,并且可以很好地迁移到未见过的任务,突出了其鲁棒性和泛化能力。