论文

PG-VP:以物理风险视觉提示复用冻结 VLA 导航

Seeing the Invisible: Physics-Guided Visual Prompting for Temperature- and Radiation-Aware VLA Navigation

智能体系统Agent 环境交互

摘要

视觉-语言-动作(VLA)模型已成为视觉和语言导航(VLN)的主要范例。然而,在安全关键型设施中,RGB 摄像头无法检测到辐射或温度峰值等隐形风险,并且处理每种风险的成本高昂,需要新的编码器、新数据和模型重新训练。我们提出了物理引导视觉提示(PG-VP),这是一种即插即用的多模态感知模块,它重用了冻结的 VLA 模型已经做得很好的功能:避开可见障碍物。给定近端辐射或热源,PG-VP 会执行物理引导的风险评估,以确定躲避方向,并覆盖在连续帧上移动的相应虚拟障碍物(动态视觉提示)。导航策略自然而然地绕开了这个看不见的危险。无论危险类型如何,都使用相同的虚拟障碍物,因此在添加传感器时视觉提示模式保持固定。当没有检测到危险时,不会渲染任何内容,并且策略的行为与没有 PG-VP 时完全相同。我们使用 R2R-CE 和 RxR-CE 的 val-unseen 分割来评估 OmniNav 上的 PG-VP,它在 84.9% 和 83.2% 的情况下指导策略采取预期的低风险行动,但导航成功率分别降低了 6.8 个和 7.9 个百分点。我们在存在实际热源和辐射源的情况下,在真实机器人上的不同场景中进一步测试它,所有这些都无需任何重新训练。真实测试表明,PG-VP有效避免了这些看不见的危险,对热源和辐射源的最差10%平均弹道安全性分别提高了63.45%和32.59%。

PG-VP:以物理风险视觉提示复用冻结 VLA 导航:论文原图
图 1:PG-VP 框架概述。