论文
Carnator:按生成状态兼容性复用历史视频计算
Carnator: Fast Text-to-Video Generation with Generation-Native Compatibility-Guided Cross-Request Reuse
摘要
视频扩散转换器可生成高质量视频,但迭代去噪会导致大量推理延迟,从而限制了交互式和大规模服务。大多数现有的加速方法都侧重于个体请求,从而将效率增益限制在单代轨迹内的冗余。最近的跨请求重用提供了额外的节省来源,但现有方法通常从粗略的语义相似性推断可重用性。这将语义相关性与生成级计算兼容性混为一谈,因此积极的重用可能会接受不兼容的历史计算,而保守的重用则无法实现实质性的加速。我们提出了 Carnator,这是一个跨请求加速框架,它通过直接从模型不断演变的内部状态中提取和使用生成本机兼容性证据来解决这一挑战。具体来说,Carnator 执行轻量级早期探测,从内部扩散状态构建早期签名,通过风险意识兼容性决策评估重用有效性。相同的证据通过本地化特定于目标的计算并指导历史潜在轨迹和稀疏注意力连接的联合重用来描述重用范围。在三个文本到视频主干中,尽管有更多选择性的缓存接受,Carnator 始终实现比评估的交叉请求基线更高的缓存命中端到端加速,在保持有竞争力的生成质量的同时达到高达 2.17$\times$ 的加速。