论文
薛定谔的猫:潜在场景运动学的概率表示和预测
Schrödinger's Cat: Probabilistic Representation and Prediction of Potential Scene Kinematics
摘要
预测场景如何从部分观察中演变需要对多种可能的未来进行推理,而不是遵循单一的轨迹。现有方法要么生成外观主导的视频预测,要么对少量轨迹进行采样,而无需对可能运动的分布进行显式建模。我们引入了未来 kInEmatic 潜在分布的目标感知表示(GARFIELD),这是一种场景运动学的概率模型,它学习给定图像和可选的时空稀疏约束的可能未来分布的结构化时空潜在表示。相同的潜在表示既可以对所有轨迹进行联合采样,又可以通过高效的确定性密度解码器直接访问底层运动分布。因此,未来运动的不确定性可以定位于特定的场景元素和时间步长,并通过附加约束逐步细化。实验证明,运动规划性能强大,可与大型视频生成模型相媲美,同时轨迹采样速度加快 97 倍。我们的方法进一步估计运动密度,比运动生成模型中的蒙特卡罗采样快两个数量级,从而实现交互式探索和不确定性感知规划。