论文

DramaChain Bench:短剧生成的端到端基准

DramaChain Bench: An End-to-End Benchmark for Short-Drama Generation

模型评测基准与评测资源

摘要

商业短剧的制作遵循多阶段链条:剧本、故事板、关键帧图像、镜头级视频和完成的短剧。大多数现有基准仅使用预先编写的输入而不是真实的上游管道输出来评估视频生成阶段。这留下了两个无法回答的关键问题:每个阶段是否遵循原始脚本意图(而不仅仅是其直接输入提示),以及不同的镜头在组装成多集版本后是否保持连贯。我们推出 DramaChain Bench,这是第一个评估完整制作链每个阶段的短剧基准。它建立在共享一维系统——DramaChain Dimensions 的三个内部系统之上:在每个阶段实例化五个评估轴,解析为 63 个叶子维度。 DramaChain Agent 在工作流程和成品质量上都针对商业短剧平台进行了校准,可以实现跨模型的阶段性公平比较。 DramaChain 标签系统的 5,785 个项目中的每一个都由三位专业注释者独立评分,所有缺陷都进行了时空定位并从预定义的缺陷列表中选择。此过程产生 17,488 个有效分数和 255,925 个可追溯的归因记录。人工注释证实上游缺陷会在整个管道中级联,这表明最终剧集的质量不仅仅由视频生成决定。然后,DramaChain Agentic Judge 自动对每个叶子尺寸进行评分,在根据每个项目的清单进行判断之前,通过多轮 Agentic 轮次收集证据;它以平均 PLCC 0.918 重现模型排名,足以在无需注释成本的情况下接纳新模型。

DramaChain Bench:短剧生成的端到端基准:论文配图
图1 戏剧法官团概况。Drama Chain尺寸即刻地在全部六个生产颗粒上使用五个评价轴,Drama Chain剂生产这些物品,Drama Chain标签系统对每一个物品都进行注解,Drama Chain智能体法官自动复制这些说明。