论文

SPATIOROUTE:用于零样本空间推理的动态提示路由

SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning

上下文与知识上下文工程

摘要

对以自我为中心的视频进行空间问答是一项具有挑战性的任务,需要视觉语言模型 (VLM) 来推理 3D 对象位置、场景可供性和方向关系,特别是在没有特定任务 微调 可用的零镜头设置中。我们引入了 SpatioRoute,这是一种动态提示生成方法,它将每个传入的问题路由到语义定制的提示模板 - 无需任何额外的训练、微调 或 3D 传感器输入。 SpatioRoute 以两种互补模式运行:SpatioRoute-R,一种基于规则的路由器,可确定性地将问题类型(例如,What、Is、How、Can、Which)映射到专门的提示模板; SpatioRoute-L,一种 LLM 驱动的方法,仅根据问题和情境上下文生成特定于任务的提示,在路由时无需视频输入。我们在跨模型系列的 VLM 的 SQA3D 基准上评估 SpatioRoute。 SpatioRoute 与固定提示基线相比,实现了高达 5% 的一致整体精度增益,为零镜头纯视频空间 VQA 建立了新的最先进技术,无需 3D 点云输入。作为另一个发现,我们观察到通过 Think it Twice 架构实现的思想链 (CoT) 提示在 Qwen 系列模型的这种设置中持续降低性能,这证实了问题感知路由比空间视频理解的统一推理指令更有效。