论文
潜在清晰度:将世界模型运动学与语义流形联系起来以实现视频异常预期
Latent Clarity: Bridging World-Model Kinematics to Semantic Manifolds for Video Anomaly Anticipation
摘要
连续视频异常检测以反应式多实例学习 (MIL) 为主,它将时空特征分解为标量分数。我们引入了 PULS(预测统一潜在空间),这是一个连续语义世界模型管道,包含两个模块:490M 参数 KSD 桥(运动学到语义 蒸馏)和 1680 万参数预期状态预测器(ASP)。 KSD Bridge 将 V-JEPA 2 物理张量映射到 2048-d Qwen3-VL-Embedding-2B 文本对齐超球面,并在 UCF-Crime 的子集上进行训练。仅此翻译就可以为 UCF-Crime 生成 0.8994 的块级 AUROC,为没有 MIL 或分层融合的分布外 XD-Violence 生成 0.8162 的块级 AUROC。我们引入并验证了潜在清晰度假设:因为 JEPA 的时间预测器在保留运动学的同时丢弃了任意像素噪声,所以预期的未来表示比观察到的当前表示在语义上更具可分离性。 ASP 锐化了这些预期的未来潜伏,实现了 44.5% 的平均 14 路零样本 VQA 准确率(超出观察基线 +9.6 pp)。将 ASP 应用于观测张量可将准确度降低至 7.3%(随机机会),证明预期和观测占据不同的子流形。具有 L1 惊喜门的三轨前置时间协议在 T-0.5 秒(p < 0.001,N = 1,000 排列)时产生峰值 +8.9 pp 预期优势,将物理预期与静态场景先验分开。零样本转移到 XD-Violence 证实了牛顿不变运动学表示可以推广到分布外。