论文

X+Slides:受众条件化幻灯片生成基准

X+Slides: Benchmarking Audience-Conditioned Slide Generation

模型评测基准与评测资源

摘要

从源文档自动生成幻灯片是大语言模型(LLM)的重要应用。既有基准主要评估幻灯片完备性与技术深度——忽视目标受众这一关键现实因素。例如——专家要求严谨证明——决策者优先可行动结论。为弥合该缺口——我们介绍X+Slides——专为受众条件化幻灯片生成设计的基准。建立在横跨113主题与七个演示场景的多样语料上——X+Slides采用由8,133条去重、源锚定探针构建的动态评估框架。通过为同一批源锚定探针指派受众专属效用权重——X+Slides报告四个互补指标:受众覆盖率——度量传达了多少受众必要信息;域内覆盖——显示覆盖了哪些信息类型;效率——度量单位注意力成本交付的效用;正确性——验证幻灯片声明是否有源支撑。在DeepPresenter、SlideTailor与NotebookLM上的实验表明:当前系统能恢复相当但仍不完整的受众必要信息:τ_A=0.7时——DeepPresenter最佳受众覆盖0.714——SlideTailor 0.594——NotebookLM消融达0.853但锚定差异明显。这些结果表明:在没有源锚定评估的情况下——视觉质量与宽泛主题覆盖不应被视为证据支撑。

X+Slides:受众条件化幻灯片生成基准:论文配图
图 1:用于幻灯片评估的 X+Slides 工作流程。给定源文档、受众概况、使用场景和生成的幻灯片,X+Slides 应用特定的探测权重,验证源支持的可回答性,并报告受众条件的评估指标。