论文
DECKBench:评测用于学术幻灯片生成与编辑的多智能体框架
DECKBench: Benchmarking Multi-Agent Frameworks for Academic Slide Generation and Editing
摘要
自动生成并迭代编辑学术幻灯片,所需的远不止文档摘要。它要求忠实的内容选择、连贯的幻灯片组织、布局感知的渲染以及稳健的多轮指令遵循。然而,现有基准与评估协议无法充分衡量这些挑战。为填补这一空白,我们提出 Deck Edits and Compliance Kit Benchmark(DECKBench),一个面向多智能体幻灯片生成与编辑的评估框架。DECKBench 构建在一个经筛选的“论文到幻灯片”配对数据集之上,并用真实的模拟编辑指令加以扩充。我们的评估协议系统考察幻灯片级与整套幻灯片级的内容忠实度、连贯性、布局质量与多轮指令遵循。我们还实现了一个模块化多智能体基线系统,将幻灯片生成与编辑任务分解为论文解析与摘要、幻灯片规划、HTML 创建以及迭代编辑。实验结果表明,所提基准能够突出优势、暴露失败模式,并为改进多智能体幻灯片生成与编辑系统提供可操作的洞见。总体而言,这项工作为学术演示内容生成与编辑的可复现、可比较评估奠定了标准化基础。代码与数据已在 https://github.com/morgan-heisler/DeckBench 公开。
