论文
Script-a-Video:通过分解流和关系对齐实现深度结构化视听描述
Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding
摘要
多模态 大语言模型 (MLLM) 的进步正在将视频描述从描述性端点转变为用于视频理解和生成的语义接口。然而,主流范式仍然将视频视为单一的叙事段落,其中纠缠着视觉、听觉和身份信息。这种密集耦合不仅会损害表征保真度,还会限制可扩展性,因为即使是本地编辑也可能会触发全局重写。为了解决这个结构瓶颈,我们提出了多流场景脚本(MTSS),这是一种新颖的范例,用分解且明确的场景描述取代单一文本。 MTSS 基于两个核心原则:流分解,将视频解耦为互补流(参考、镜头、事件和全局);关系对齐,通过显式身份和时间链接重新连接这些孤立的流,以保持整体视频一致性。大量实验表明,MTSS 持续增强了各种模型的视频理解,在 Video-SALMONN-2 上实现了总错误率平均降低 25%,在 Daily-Omni 推理基准上平均性能提升了 67%。它还缩小了较小和较大 MLLM 之间的性能差距,表明描述界面更加易于学习。最后,即使没有架构调整,在多镜头视频生成中用 MTSS 取代单一提示也会产生显着的人类评价改进:跨镜头身份一致性提高 45%,视听对齐提高 56%,时间可控性提高 71%。