论文
重要时思考:使用 RL 策略进行社交导航的条件 VLM 推理
Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies
摘要
随着移动机器人越来越融入日常人类环境,社交机器人导航对于确保人类舒适、安全和信任变得至关重要。虽然强化学习(RL)导航策略提供了实时部署所需的快速推理和反应行为,但它们仍然缺乏灵活的语义推理能力,并且通常无法泛化到复杂的社交场景。最近的方法越来越多地转向视觉语言模型(VLM)来代替强化学习策略,以改善机器人导航中的语义和社会推理。然而,它们的高计算成本和缓慢的推理仍然是实时部署的主要障碍。为了克服这些限制,我们引入了 HUMA(多模式社交导航的混合理解),这是一种混合架构,可以动态平衡 RL 策略的计算效率与 VLM 的深度语义理解。我们的方法使用反应式 RL 策略来处理低密度、常规导航任务,同时在人类进入敏感情况(例如机器人的邻近区域)时在训练后的高级 VLM 上对其进行调节。我们在 Social-MP3D 和 Social-HM3D 基准上评估 HUMA,它的任务成功率分别提高了 20% 和 3%,同时与最先进的基准相比,显着减少了个人空间侵犯和人体碰撞。广泛的消融研究验证了每个架构组件,并且在 Mirokaï 移动机器人上的实际部署进一步证明了我们方法的实际可行性。