论文

SAGE:通过归因引导规则进化实现自进化的分镜技能

SAGE: Self-Evolving Storyboard Skills via Attribution-Guided Rule Evolution

应用与实践智能体系统Agent Skills内容创作

摘要

分镜把剧本转化为视觉镜头规划,服务于自动化短剧制作。专业分镜依赖隐性的导演经验,仍是产业化瓶颈。大语言模型可以自动化这一环节,但供给导演知识的方法面临三个挑战:(1)知识获取:这门手艺仍隐含在范例中,或必须人工撰写。(2)知识精炼:已编写的知识不会对照执行结果进行评估,且不透明的生成过程使反馈无法归因到每个决策背后的知识。(3)知识注入:注入全部知识超出可用上下文,而给每个叙事组人工挑选知识又无法扩展。我们提出SAGE(Skill with Attribution-Guided Evolution),一个已部署的框架,从专家演示中学习、归因、进化和路由导演知识。SAGE通过对比每个训练剧本与其专家分镜,推导出与剧集内容无关的规则。生成过程中,模型记录每个叙事组采用的规则;把这些记录与局部反馈结合,即可对单个规则做针对性更新。进化后的规则形成带路由索引的场景包,每个叙事组只检索适合自身情境的有界规则集,无需专家介入。在三个题材的18个测试剧集上,SAGE在经专家验证的评分细则上得77.8分,专业导演为77.1分。在Virtual Film Studio部署14天,SAGE产出1,344个叙事组输出;87.2%无需实质性修改即被接受,制作团队记录每集创作时间减少超过83%。我们发布PROSE,首个公开的剧本与专业导演分镜配对数据集,覆盖68个剧集:https://github.com/creDreams/PROSE。

SAGE:通过归因引导规则进化实现自进化的分镜技能:论文配图
图1. 在相同剧本、骨干 LLM 与分镜模式下,对《His Toyboy》EP001(一个留出测试剧集)中某一剧本节拍(beat)的镜头语言决策。只有 SAGE 选择了强化 Victor 支配地位的低角度推近(push-in),而 Few-shot 与 CoT 保持平角,Vanilla 则拉宽为削弱权力关系的构图。只有文字记录是系统输出;缩略图与威胁标签为事后解读,不参与评估。五个堆叠行在某一剧本节拍上比较四个系统。最上一行给出输入的剧本台词。随后四行分别对应 SAGE、Few-shot、CoT 与 Vanilla。这些行中每行包含一条文字分镜记录、景别、机位角度与摄影机运动三个镜头语言字段、一幅灰度缩略图以及一个威胁等级指示。SAGE 行列出特写、低角度与推近。其余三行列出平角与固定机位。最后一行总结比较结果。