论文

VIS-Ground:以上下文约束支持交互式视频叙事

VIS-Ground: Video Interactive Storytelling with Contextual Grounding

应用与实践模型推理上下文与知识推理验证与自校正上下文工程内容创作

摘要

视频互动讲故事使观看者能够主动引导视频的展开方式。然而,一旦我们允许观看者在生成过程中进行干预,就会出现一个新的挑战:观看者的请求可能对Grounding源和当前渲染的视频状态都有潜在的依赖性。这些依赖关系可能不会在任何单独的输入中明确说明,但只有在共同考虑源、渲染历史和新观看者意图时才会出现。现有的交互式视频生成系统主要强调遵循观看者指令,而基于源的视频生成方法则侧重于将生成的内容与外部叙述或知识源对齐。这就留下了一个尚未得到充分探索的基本问题:在交互延续过程中,生成模型应该建立在什么背景下,以及如何将异构的、非结构化的输入转化为这样的Grounding上下文?在这项工作中,我们将上下文Grounding定义为将异构输入上下文转换为视频生成的可执行约束模型的过程。为了应对这一挑战,我们引入了 VIS-Ground,它执行结构化上下文抽象以恢复Grounding状态和跨上下文依赖关系,执行生成约束归纳以将相关依赖项投影到特定于候选者的约束中,并使用约束视频生成来通过规划、验证、修订和渲染来强制执行这些约束。在三个视频生成主干中,VIS-Ground 始终获得最高的总体综合得分,与最强的每主干基线相比,平均绝对提高了 10.3 分。详细的分析进一步显示了叙事和知识Grounding方面的收获,并揭示了依存关系提取和视频渲染过程中忠实实现方面仍然存在的挑战。

VIS-Ground:以上下文约束支持交互式视频叙事:论文原图
图 2:VIS-Ground 概述。结构化上下文抽象将视频、故事和源状态对齐到 ℳ\mathcal{M} 中。生成约束归纳从 ℳ\mathcal{M} 导出依赖关系 ℛ\mathcal{R} 并激活候选特定约束 𝒞\mathcal{C}。受限视频生成使用脚本和视频验证来修复前缀 vprefixv_{\mathrm{prefix}} 和观看者请求中的延续 vcontv_{\mathrm{cont}}。