论文

连接器中存在哪些语义?诊断视频编辑中的 VLM 到 DiT 对齐情况

What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing

模型评测基准与评测资源

摘要

基于流匹配的视频生成模型越来越依赖预置的视觉语言模型 (VLM) 来处理复杂的、基于指令的视频编辑。该范式背后的普遍假设是连接器模块可以将 VLM 丰富的多模态推理与 DiT 的原始文本嵌入空间无缝地对齐。然而,我们假设这种对齐是一个严重的语义瓶颈,降低了细粒度结构变量的性能。验证这一点具有挑战性,因为端到端评估将对齐失败与生成错误混为一谈,并且自然数据集缺乏解开的注释。为了严格研究这一点,我们提出了一种基于视频合成的受控数据处理管道,从而产生了 TRACE-Edit,这是一个专注于基于关系的编辑的诊断数据集。利用该数据集,我们提出了一种全面的诊断协议来分析现有视频编辑模型中元查询和连接器的两个重要设计。对四个代表性模型案例的系统评估表明,细粒度结构语义在对齐过程中可能会严重退化。我们的研究结果推翻了无损语义传输的假设,将 VLM 到 DiT 对齐确定为主要瓶颈,并为未来的多模态对齐架构提供了新的诊断基础。