论文
TIE:用于事件视频生成的时间间隔编码
TIE: Time Interval Encoding for Video Generation over Events
摘要
导演式提示、机器人动作预测和交互式视频代理需要对并发事件进行时间基础——在这种情况下,68% 的一般剪辑和超过 99% 的机器人/游戏剪辑包含重叠事件,但现有的多事件生成器依赖于单活动提示假设。然而,现代视频生成器,例如 Diffusion Transformer (DiT),通过逐点位置编码将时间表示为离散点。这种公式造成了基本的维度不匹配:时间上延长的间隔和重叠事件在数学上对于注意力机制来说是无法表示的。在本文中,我们提出了时间间隔编码(TIE),这是一种有原则的、即插即用的间隔感知泛化旋转嵌入,将时间间隔提升为 DiT 交叉注意力内的一流原语。我们没有引入另一种启发式间隔嵌入,而是表明,在与 RoPE 兼容的双线性注意力中,TIE 具有两个基本原则:时间可积性(要求事件在其整个持续时间内聚合位置证据)和持续时间不变性(消除对较长间隔的微小偏差)。在统一内核下,这种表征产生了一种高效的基于 sinc 的封闭式解决方案,该解决方案保留了标准注意力接口,并通过区间积分自然地衰减了边界噪声。根据经验,TIE 保留了基本 DiT 模型的视觉质量,同时显着提高了时间可控性。在我们对 OmniEvents 数据集的实验中,它将人类验证的时间约束满意度从 77.34% 提高到 96.03%,并将时间边界误差从 0.261 秒降低到 0.073 秒,同时还提高了轨迹级时间对齐指标。代码和数据集可在 https://github.com/MatrixTeam-AI/TIE 获取。