论文

超越端到端视频模型:基于LLM的多智能体教育视频生成系统

Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation

应用与实践内容创作

摘要

尽管最近的端到端视频生成模型在面向视觉的内容创建方面表现出了令人印象深刻的性能,但它们在需要严格逻辑严谨性和精确知识表示的场景中仍然受到限制,例如教学和教育媒体。为了解决这个问题,我们提出了 LAVES,这是一种基于 LLM 的分层多智能体系统,用于根据教育问题生成高质量的教学视频。 LAVES 将教育视频生成制定为一项多目标任务,同时要求正确的逐步推理、教学上连贯的叙述、语义上忠实的视觉演示以及精确的视听对齐。为了解决先前方法的局限性(包括程序保真度低、生产成本高和可控性有限),LAVES 将生成工作流程分解为由具有明确质量门和迭代批评机制的中央编排代理协调的专门代理。具体来说,编排代理监督解决方案代理进行严格的问题解决,插图代理生成可执行的可视化代码,以及叙述代理用于面向学习者的教学脚本。此外,工作代理的所有输出都受到语义批评、基于规则的约束和基于工具的编译检查。该系统不是直接合成像素,而是构建一个结构化的可执行视频脚本,该脚本使用模板驱动的组装规则确定性地编译成同步的视觉效果和旁白,从而实现完全自动化的端到端制作,无需手动编辑。在大规模部署中,LAVES 的吞吐量每天超过 100 万个视频,与当前行业标准方法相比,成本降低了 95% 以上,同时保持了较高的接受率。

超越端到端视频模型:基于LLM的多智能体教育视频生成系统
图1:LASEV 框架概览。编排智能体(Orchestrating Agent)通过迭代式质量评审和基于模板的视频组装,协调三个专门的工作智能体——Solution Agent、Illustration Agent 和 Narration Agent。教育视频由此从组装好的可执行视频脚本(EVS)渲染生成。