论文

当数字说话时:在文本到视频扩散模型中对齐文本数字和视觉实例

When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

模型推理解码与生成控制

摘要

文本到视频的扩散模型已经实现了开放式视频合成,但通常难以生成提示中指定的正确数量的对象。我们引入了 NUMINA,这是一个用于改进数值对齐的 无需训练 识别然后引导框架。 NUMINA 通过选择有区别的自注意力和交叉注意力头来识别提示布局不一致,以得出可数的潜在布局。然后,它保守地完善该布局并调节交叉注意力以指导再生。在推出的 CountBench 上,NUMINA 将 Wan2.1-1.3B 的计数精度提高了 7.4%,在 5B 和 14B 型号上分别提高了 4.9% 和 5.5%。此外,在保持时间一致性的同时,CLIP 对齐得到了改进。这些结果表明,结构指导补充了种子搜索和提示增强,为计数准确的文本到视频传播提供了实用途径。代码可在 https://github.com/H-EmbodVis/NUMINA 获取。