论文

接下来会发生什么?用于评估基于故事的全模式生成的 Omni-StoryBench

What Comes Next? Omni-StoryBench for Evaluating Story-Grounded Omnimodal Generation

模型评测基准与评测资源

摘要

全模式评估应该超越独立的文本、图像和语音生成:单独可信的输出可能无法表达连贯的共享事件。我们推出了 Omni-StoryBench,这是一个基于故事的全模式基准,评估模型是否能够在图像、叙述和语音方面连贯地延续故事。每个实例都提供当前的故事书页面和结构化的下一页条件,要求模型生成下一个插图、旁白和角色口语。 Omni-StoryBench 包含来自公开许可的儿童读物的 900 个经过严格验证的故事过渡,以及真实的下一页参考资料和语音元数据。我们使用特定于模态的指标和以一致性为中心的大语言模型作为评审的标准来评估系统,以实现上下文保存、条件跟踪、参考一致性和跨模态一致性。在涵盖编排、半编排和本机任意到任意范式的 32 种基线配置中,我们发现具有强大 VLM 规划的编排最可靠,而当前的本机全模式模型经常在输出完整性和可控性方面遇到困难。我们的分析表明,文本端性能与图像和语音质量相关,但图像生成和视觉连续性构成了评估配置中最明显的观察到的瓶颈。这些结果使 Omni-StoryBench 成为衡量相干全模态生成超越孤立模态质量的系统级基准。