论文

焦点扩散:高效的空间自适应图像和视频生成

Foveated Diffusion: Efficient Spatially Adaptive Image and Video Generation

模型推理推理加速

摘要

扩散和流匹配模型解锁了前所未有的创意内容创建功能,例如交互式图像和流视频生成。然而,对更高分辨率、帧速率和上下文长度的需求不断增长,使得高效生成变得越来越具有挑战性,因为计算复杂性随着生成的词元数量呈二次方增长。我们的工作旨在优化用户注视位置已知或可以估计的设置中的生成过程的效率,例如通过使用眼动追踪。在这些设置中,我们利用了人类视觉的偏心率相关的敏锐度:当用户在其注视位置(中央凹区域)周围的小区域中感知非常高分辨率的视觉信息时,解析细节的能力在视野外围迅速降低。我们的方法从对中心凹分辨率进行建模的掩模开始,以非均匀地分配词元,将较高的词元密度分配给中心凹区域,并将较低的密度分配给外围区域。图像或视频是在混合分辨率词元设置中生成的,产生的结果在感知上与全分辨率生成没有区别,同时大大减少了词元数量和生成时间。为此,我们开发了一种直接从高分辨率数据构建混合分辨率词元的原则机制,允许从现有基础模型对中心点扩散模型进行后训练,同时保持跨分辨率的内容一致性。我们通过广泛的分析和精心设计的用户研究验证了我们的方法,证明了注视点作为高效生成的实用且可扩展的轴的功效。