论文

SEAM:面向规模化短剧一致生成的镜头实体属性记忆

SEAM: Shot Entity-Attribute Memory for Consistent Short-Drama Generation at Scale

上下文与知识记忆Agent记忆

摘要

短剧生成已发展成庞大的工业化流水线,当它从孤立镜头扩展到剧集层面时,视觉连续性成为关键瓶颈。当前的智能体框架逐镜头孤立生成,导致上下文在镜头之间漂移,道具、人物姿态和场面调度变得不一致。一旦拼接起来,这些微小差异就会放大成严重的视觉断裂。我们提出SEAM(Shot Entity-Attribute Memory,镜头实体属性记忆),一个免训练、与模型无关的记忆图,完全在提示文本层修复连续性:为每个镜头提取多维状态,在所得图上只检索因果上先前的上下文,对其进行选择性过滤,并通过自然语言提示重写注入存留的约束。我们还发布了SEAM-Bench,一个双盲连续性分镜基准;在该基准上,SEAM将跨剧集连续性召回率从0.700提升到0.946,在六个主流文本模型上均能泛化,并在生成图像层带来一致但尚未显著的增益。SEAM作为强制环节部署于CreativeFitting的SEAM-Agent生产流水线中的201个镜头,达到96.5%的导演接受率且零不安全注入;一个保守的反事实归因将其中至少21.9个百分点归功于其跨剧集记忆。

SEAM:面向规模化短剧一致生成的镜头实体属性记忆:论文配图
图1:跨镜头连续性断裂与 SEAM 修复。上:逐镜头独立生成丢失了较早的状态(已摘除的手套重新出现),这种矛盾任何单个镜头都无法察觉。下:SEAM 将先前状态从其记忆图注入镜头提示,使其延续,从而矛盾消失。两行各三张关键帧,对应镜头 0、4 和 7。上行按镜头独立生成,镜头 0 中已摘除的手套在镜头 4 和 7 中重新出现。下行在记忆注入下生成,空手状态在后续两个镜头中均得以保持。