论文

UniPPTBench:跨不同输入设置的演示生成的统一基准

UniPPTBench: A Unified Benchmark for Presentation Generation Across Diverse Input Settings

模型评测基准与评测资源

摘要

现有的工作通常侧重于隔离输入设置下的演示生成,而现实世界的用例跨越不同的场景,包括模糊的用户提示、长文档、多模态材料和多个异构源。此外,当前的评估往往不够具体。他们主要依赖于通用的呈现质量标准,例如视觉吸引力、布局质量和整体连贯性,但未能评估不同输入设置所需的核心功能,包括基础压缩、视觉文本对齐和跨源合成。因此,该领域缺乏统一的基准和场景感知评估框架来在不同的现实世界环境中忠实地诊断演示生成系统。我们提出了 UniPPTBench,这是跨四种代表性输入设置的演示文稿生成的统一基准:模糊提示、长文档、多模式文档和多源生成。我们进一步介绍了 UniPPTEval,这是一种场景感知评估协议,它将用于跨设置比较的共享指标与针对每个设置的核心要求量身定制的特定场景指标相结合。我们还提供透明的参考基线以支持可重复的比较。 UniPPTBench 上的实验揭示了内容基础、多模式集成和跨源合成中不同设置和反复出现的故障模式之间存在显着的性能差异。特别是,在通用演示质量指标上的出色表现并不一定意味着在扎根场景中能够出色地完成任务。 UniPPTBench 和 UniPPTEval 共同为评估不同现实场景中的演示文稿生成提供了可靠的诊断基础。代码和数据将公开。