论文

ViCross:用自适应图块投影与空间校正预测行人过街动作

Unified Vision-Centric Pedestrian Crossing Action Prediction via Adaptive Patch Projection and Proactive Spatial Rectification

模型架构新型架构

摘要

视觉线索对于行人动作预测来说是可用的并且信息丰富,但是在没有帧级外部感知线索的情况下,从视频帧中获得稳定的以目标为中心的表示仍然具有挑战性。因此,大多数方法依赖于额外的感知模块或多源信息融合,使得以视觉为中心的设置的可靠性成为一个悬而未决的问题。为此,我们提出了 ViCross,这是一种由多模态 大语言模型 提供支持的以视觉为中心的行人过路动作预测框架,它可以从视频帧中保持以目标为中心的推理,而无需除了第一帧目标初始化之外的其他感知模块。虽然多模态 大语言模型 表现出很强的视觉理解能力,但将它们直接应用于以视觉为中心的动作预测面临着两个挑战。首先,准确感知目标行人通常需要高分辨率输入和密集的视觉标记化,这使得全帧编码在计算上难以实现。 ViCross 通过可变分辨率图块映射模块解决了这个问题,以实现高效的词元分配,同时保留关键的行人细节。其次,缺少时空先验阻碍了一致的跨帧推理。 ViCross 通过空间约束增强策略来缓解这一问题,该策略捕获过去的运动、未来的位置和动作语义,以进行训练时的主动空间校正。大量实验表明,ViCross 在以视觉为中心的预测设置中提供了明显的收益,并且在多种设置中与多源融合方法具有竞争力。代码可在 https://github.com/2tianyao1/ViCross.git 获取。