论文

使用统一多模式 LLM 定制视觉叙事

Customized Visual Storytelling with Unified Multimodal LLMs

应用与实践内容创作

摘要

多模式故事定制旨在根据文本描述、参考身份图像和镜头类型生成连贯的故事流。虽然故事生成方面的最新进展已显示出可喜的结果,但大多数方法都依赖于纯文本输入。一些研究纳入了角色身份线索(例如面部识别),但缺乏更广泛的多模式调节。在这项工作中,我们引入了 VstoryGen,这是一个多模式框架,它将描述与角色和背景参考集成在一起,以实现可定制的故事生成。为了增强电影多样性,我们通过对电影数据进行参数有效的提示调整来引入镜头类型控制,使模型能够生成更忠实地反映电影语法的序列。为了评估我们的框架,我们建立了两个新的基准,从角色和场景一致性、文本视觉对齐和镜头类型控制的角度评估多模式故事定制。实验表明,与现有方法相比,VstoryGen 实现了更高的一致性和电影多样性。