论文
BOOKAGENT:通过多智能体认知校准编排安全意识视觉叙事
BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration
摘要
大型生成模型 (LGM) 的最新进展彻底改变了多模式生成。然而,生成插图故事书仍然是一个开放的挑战,之前的工作主要是将这项任务分解为不同的阶段,因此,整体的多模式基础仍然有限。此外,虽然安全对齐是针对仅文本或图像的生成进行研究的,但现有的工作很少将特定于儿童的安全约束集成到叙事规划和序列级多模态验证中。为了解决这些限制,我们提出了 BookAgent,这是一种具有安全意识的多智能体协作框架,专为高质量、具有安全意识的视觉叙事而设计。与之前假定固定故事情节顺序的故事可视化模型不同,BookAgent 的目标是通过联合规划、编写脚本、说明和全局修复不一致之处,从用户草稿中进行端到端的故事书合成。为了确保精确的多模式基础,BookAgent 动态校准文本脚本和视觉布局之间的页面级对齐。此外,BookAgent 通过验证并纠正角色身份和故事讲述逻辑中的全局不一致,从时间维度校准整体一致性。大量实验表明,BookAgent 在叙事连贯性、视觉一致性和安全合规性方面显着优于当前方法,为复杂的多模式创建中的可靠代理提供了强大的范例。该实现将在 https://github.com/bogao-code/BookAgent/tree/main 公开发布。