论文
在安全关键情况下使用蒸馏视觉语言模型进行事件自适应运动规划
Event-Adaptive Motion Planning with Distilled Vision-Language Model in Safety-Critical Situations
摘要
安全关键场景中的机器人导航面临着不可预见的语义事件的重大挑战,其中碰撞主要来自动态代理的不可预测的行为,而不是看不见的物体。虽然大型视觉语言模型 (VLM) 在常识推理方面提供了卓越的功能,但在连续控制循环中频繁调用它们会带来严重的计算延迟,从根本上破坏物理执行的稳定性。为了应对这些挑战,我们提出了事件自适应运动规划(EAMP),这是一种基于 VLM 的机器人导航的有效框架。具体来说,可提示配置的语义事件触发器(PC-SET)通过持续监控短时间片段的行为异常来选择性地激活语义干预。触发后,事件触发的蒸馏 SemNav-VLM 通过物理验证的语义 蒸馏 进行微调,将检测到的异常映射到离散的策略级决策。随后,语义模型预测控制(SMPC)模块将这些策略转化为优化目标和几何参考的动态重新配置。在安全关键型物流场景中进行的大量实验表明,EAMP 有效地将高级推理与底层控制结合起来,在现有基线上显着提高动态安全裕度,同时保持实时效率。