论文

DECKBench:评测用于学术幻灯片生成与编辑的多智能体框架

DECKBench: Benchmarking Multi-Agent Frameworks for Academic Slide Generation and Editing

智能体系统Agent任务评测

摘要

自动生成并迭代编辑学术幻灯片,所需的远不止文档摘要。它要求忠实的内容选择、连贯的幻灯片组织、布局感知的渲染以及稳健的多轮指令遵循。然而,现有基准与评估协议无法充分衡量这些挑战。为填补这一空白,我们提出 Deck Edits and Compliance Kit Benchmark(DECKBench),一个面向多智能体幻灯片生成与编辑的评估框架。DECKBench 构建在一个经筛选的“论文到幻灯片”配对数据集之上,并用真实的模拟编辑指令加以扩充。我们的评估协议系统考察幻灯片级与整套幻灯片级的内容忠实度、连贯性、布局质量与多轮指令遵循。我们还实现了一个模块化多智能体基线系统,将幻灯片生成与编辑任务分解为论文解析与摘要、幻灯片规划、HTML 创建以及迭代编辑。实验结果表明,所提基准能够突出优势、暴露失败模式,并为改进多智能体幻灯片生成与编辑系统提供可操作的洞见。总体而言,这项工作为学术演示内容生成与编辑的可复现、可比较评估奠定了标准化基础。代码与数据已在 https://github.com/morgan-heisler/DeckBench 公开。

DECKBench:评测用于学术幻灯片生成与编辑的多智能体框架
图3:幻灯片生成流水线概览(见第 5 节)。用户指令由 outline agent 处理,它提取论文关键内容并生成幻灯片大纲,随后由 code agent 将其转换为可编译的 HTML 幻灯片。本图展示了系统架构示意图。总体而言,用户指令进入 outline agent,它基于用户偏好进行推理并调用信息提取工具从原始论文中提取必要信息,从而创建幻灯片大纲;大纲随后被送入 code agent,由其为生成的幻灯片组创建可编译的 HTML 代码。