论文
KathaTrace:诊断生成的视觉叙事中的语义轨迹崩溃
KathaTrace: Diagnosing Semantic Trajectory Collapse in Generated Visual Narratives
摘要
视觉叙事是故事板、漫画、儿童媒体和电影预览的核心,观众只能从图像中理解故事。最近的生成器(例如 StoryDiffusion)可生成连贯的序列,但视觉连贯性并不能保证源故事转换意义仍然可恢复。现有的基准评估视觉质量、内容 忠实性 和场景连贯性,但错过了一个关键的失败模式:故事板中的场景在视觉上显得连贯,而场景之间的语义链接却消失了。我们引入了 KathaTrace,一种与生成器无关的协议,用于诊断语义轨迹崩溃,定义为理解一个场景如何跟随另一个场景所需的转换意义的丢失。 KathaTrace 在三种证据条件下评估转换:纯文本、纯图像和文本加图像,并过滤不明确的项目。我们贡献了 KathaBench-25K,其中包含来自包括《伊索经》、《五卷经》和《Kathasaritasagara》在内的经典著作的 5,000 个叙述、20,000 个转换和 28,712 个可恢复性问题。我们将语义轨迹间隙(STG)定义为纯文本减去纯图像的可恢复性,测量可视化过程中丢失的过渡意义。人类验证得出 Fleiss 的 kappa = 0.845。对最先进的生成模型进行的实验表明,STG 高达 23.5 +/- 1.3。 Semantic Compass 是一种可操作性探针,使用 KathaTrace 信号进行生成后修复并改进故事板选择。