论文
LogiStory:多图像故事可视化的逻辑感知框架
LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization
摘要
生成连贯且可交流的视觉序列(例如图像序列和视频)仍然是当前多模态系统的重大挑战。尽管视觉质量和世界知识的整合取得了进步,但现有模型仍然难以保持逻辑流程,常常导致动作脱节、叙述支离破碎和故事情节不清晰。我们将这些问题归因于缺乏对视觉逻辑的关注,视觉逻辑是视觉序列生成的一个关键但尚未充分探索的维度,我们将其定义为随着时间的推移角色、动作和场景之间的感知和因果连贯性。为了弥补这一差距,我们提出了一种逻辑感知的多图像故事可视化框架 LogiStory。该框架是围绕故事可视化中显式建模视觉逻辑的核心创新而构建的。为了实现这个想法,我们设计了一个多智能体系统,该系统可以根据角色、提取因果链并验证故事级别的一致性,将叙事连贯性从图像生成的隐式副产品转变为显式的建模目标。这种设计有效地将结构化故事规划与视觉生成联系起来,提高了故事可视化中的叙事清晰度和视觉质量。此外,为了评估生成能力,我们构建了 LogicTale,这是一个包含丰富注释故事的基准,强调因果推理和视觉逻辑可解释性。我们建立了全面的自动和人工评估协议,旨在测量视觉逻辑和感知质量。实验表明,我们的方法显着改善了生成的视觉故事的叙事逻辑。这项工作为在一般图像序列和视频生成任务中建模和实施视觉逻辑提供了基础步骤。