论文
RISE:跨 3D 跟踪和结构化视觉语言推理的路边基础设施序列理解
RISE: Roadside Infrastructure Sequence Understanding across 3D Tracking and Structured Vision-Language Reasoning
摘要
我们提出了 RISE(路边基础设施序列理解和评估),这是一个涵盖路边序列中的度量 3D 跟踪和结构化视觉语言推理的框架。对于度量跟踪,我们的纯图像方法将 SAM3 视频身份与用于多视图身份关联的校准引导掩模协议相结合,无需 LiDAR 或特定于任务的 3D 训练即可恢复持久的 3D 轨迹。其校准条件几何结构允许在不同的校准多摄像机交叉点实例化该过程,而无需特定于布局的重新训练。在来自 6 个十字路口的 20 个经过人工审核的片段中,生成的轨迹在定义的多视图评估范围内达到了 66.9 MOTA。对于结构化视觉语言推理,经过人工审查的 MLLM 管道会挖掘高价值片段,并使用受约束的全上下文 Oracle 来构建基于 bbox 的预测 QA,而无需将未来的证据暴露给评估的模型。生成的 RISE-VQA 数据集包含来自 16 个十字路口和 61 个路边视图的 557 个片段的 33,910 个 QA 对。其交叉保留的 RISE-Bench 使用确定性的特定任务指标来评估语义选择、坐标、未来框和交互集。实验表明,领域适应和时间背景带来的一致好处,同时揭示了空间基础、未来定位和交互推理方面持续存在的挑战。