论文
关于文本到视频扩散模型对硬件故障的恢复能力
On the Resilience of Text-to-Video Diffusion Models to Hardware Faults
摘要
我们首次系统地研究了随机硬件级故障下文本到视频(T2V)扩散模型的恢复能力。虽然 T2V 模型由于能够生成高质量、时间连贯且逼真的视频而被广泛用于自动视频生成,但其迭代去噪过程和时空依赖性引入了独特的故障模式。我们进行了广泛的故障注入研究,涵盖三个 T2V 模型和代表性基准的计算和内存故障。我们的结果表明(1)单个错误可使整体性能降低高达 3.7%,其中语义正确性比感知质量受到的影响更大; (2) 内存错误比计算错误更具破坏性,高阶指数位特别容易受到攻击,广泛使用的 bfloat16 比其他格式更容易受到攻击; (3) 7-28% 的故障会导致可见的伪影,包括添加对象等语义更改,这表明单个故障足以改变输出语义。我们的研究结果揭示了已部署的 T2V 系统中的可靠性风险,并激发了有关提高故障恢复能力的进一步研究。代码:\href{https://github.com/ztcoalson/T2V-Resilience}{https://github.com/ztcoalson/T2V-Resilience}。