论文
面向基于视觉的远程操作的生成预测显示:现成视频模型的零样本基准
Towards Generative Predictive Display for Vision-Based Teleoperation: A Zero-Shot Benchmark of Off-the-Shelf Video Models
摘要
远程操作系统从根本上受到通信延迟的限制,这会降低态势感知和控制性能。预测显示旨在通过呈现当前视觉状态的估计而不是延迟的观察来减轻这种限制。虽然生成视频模型的最新进展实现了高质量的视频合成,但它们是否适合延迟敏感的预测显示仍不清楚。本文提出了用于短视野预测显示的现成生成视频模型的零样本基准,没有特定于任务的 微调。我们将问题表述为基于采样轨迹的未来帧预测,并使用来自 CARLA 模拟器的模拟驾驶数据开发统一的基准测试流程。跨越基于 Transformer 和基于扩散的系列的五个公开发布的视频模型在两种分辨率和两种调节机制(多帧和单帧)下进行了评估。使用预测精度(平均绝对差)、每次部署延迟、峰值 GPU 内存使用量以及整个预测范围内的时间误差演变来评估性能。在此零样本基准测试中,没有任何测试模型能够同时实现低采样轨迹错误、无发散的每步错误行为以及源帧速率下的实时推理。增加模型规模或分辨率产生的改进是有限的,在某些情况下甚至是相反的。这些发现凸显了通用生成视频合成与远程操作中预测显示的要求之间的差距,表明实际部署将需要显式的短视野时间监督、域内适应或积极的推理优化,而不是直接应用现成的模型。代码、配置和定性结果发布在项目页面上:https://bimilab.github.io/paper-GenPD