论文
PresentAgent-2:迈向通才型多模式呈现代理
PresentAgent-2: Towards Generalist Multimodal Presentation Agents
摘要
演示文稿生成正在从静态幻灯片创建转向具有研究基础、多模式媒体和交互式交付的端到端演示视频生成。我们介绍 PresentAgent-2,一个用于根据用户查询生成演示视频的代理框架。给定开放式用户查询和选定的演示模式,PresentAgent-2 首先将查询总结为焦点主题,并对演示友好的来源进行深入研究,以收集多模式资源,包括相关文本、图像、GIF 和视频。然后,它构建演示幻灯片,生成特定于模式的脚本,并将幻灯片、音频和动态媒体组合成完整的演示视频。 PresentAgent-2在统一框架内支持三种独立的演示模式: 单演示,生成单人解说演示视频;讨论,创建具有结构化演讲者角色的多演讲者演示,例如提出指导性问题、解释概念、澄清细节和总结要点;交互,独立支持回答基于生成的幻灯片、脚本、检索的证据和演示上下文的观众问题。为了评估这些能力,我们建立了一个涵盖单一演示、讨论和交互场景的多模式演示基准,并针对内容质量、媒体相关性、动态媒体使用、对话自然性和交互基础等特定任务的评估标准。总体而言,PresentAgent-2 将演示文稿生成从依赖于文档的幻灯片创建扩展到具有多模式媒体、对话和交互的查询驱动、基于研究的演示视频生成。代码:https://github.com/AIGeeksGroup/PresentAgent-2。网站:https://aigeeksgroup.github.io/PresentAgent-2。