论文

Sol 视频推理引擎:用于高效视频生成的代理原生全栈加速框架

Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation

模型推理推理加速

摘要

现代视频扩散模型通过缩放实现了更高的生成质量,但这也增加了推理成本。尽管已经提出了许多加速方法,但一个核心挑战是,最有效的加速策略是高度特定于实例的:适用于模型、硬件和推理配置的一种组合的方案通常不会转移到另一种组合。不同的模型在架构、数值敏感性和注意力集中模式方面有所不同。推理设置在空间和时间分辨率以及视频持续时间方面有所不同,而硬件平台在内存层次结构、支持的数字格式和内核吞吐量方面有所不同。这些因素创造了很大的调整空间,使得手动性能工程成本高昂。我们推出 Sol 视频推理引擎,这是一种用于视频扩散模型的代理、原生 无需训练 加速框架。它将五种广泛适用的技术(缓存、稀疏注意力、词元修剪、量化和内核融合)组织到一个代理加速堆栈中,以实现特定于实例的优化。对于由模型、硬件平台和服务配置定义的具体部署目标,并行技能代理优化每种技术的实现,代理集成器将它们组合成全局加速堆栈,人工验证器提供有关生成质量的反馈。我们在具有不同大小和架构的三种视频模型上实例化此工作流程:64B Cosmos3-Super、22B LTX-2.3 和 2B SANA-Video。只需很少的人力,整个堆栈即可实现超过 2 倍的端到端加速,同时保持近乎无损的 VBench 质量,证明了代理框架在视频扩散加速方面的有效性。