论文
CausalChapter:通过介入依赖建模改进长视频章节
CausalChapter: Improving Long-Video Chaptering with Interventional Dependency Modeling
摘要
长篇教学视频需要自动分段以支持浏览、导航和知识访问。最近的长上下文语言模型可以根据文本化视频输入执行章节编写,但对于具有长转录本、平滑主题转换和详细章节输出的内容密集的讲座视频来说,它们仍然昂贵且脆弱。可扩展的分段然后字幕范例降低了这种成本,但引入了两个新的挑战:边界错误传播和碎片化的跨章节上下文。我们提出了 \textbf{CausalChapter},这是一种受干预启发的长视频章节框架,可通过轻量级掩蔽和删除干预来估计预测级别的影响。对于边界定位,我们的局部依赖转移模块可以检测相邻时间窗口之间的预测依赖关系的下降;对于章节描述生成,我们的跨细分支持选择模块根据历史上下文对当前预测的支持对历史上下文进行重新排序。长视频章节基准实验表明,CausalChapter 提高了边界定位、章节描述质量和跨章节连贯性。