论文

OmniScript:为长格式电影视频生成视听脚本

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

模型训练强化学习

摘要

目前的多模态 大语言模型 (MLLM) 在短视频理解方面表现出了卓越的能力,但将长电影视频翻译成详细的、基于时间的脚本仍然是一个重大挑战。本文介绍了新颖的视频到脚本(V2S)任务,旨在生成包含角色动作、对话、表情和音频提示的分层、逐场景脚本。为了促进这一点,我们构建了一个首个人类注释基准,并提出了一个时间感知的分层评估框架。此外,我们还提出了 OmniScript,这是一种专为长篇叙事理解而定制的 8B 参数全模态(视听)语言模型。 OmniScript 通过渐进式管道进行训练,该管道利用思想链监督 微调 进行情节和角色推理,然后使用时间分段奖励进行强化学习。大量实验表明,尽管其参数效率较高,但 OmniScript 在时间定位和多字段语义准确性方面的性能显着优于较大的开源模型,并实现了与最先进的专有模型(包括 Gemini 3-Pro)相当的性能。