论文
SOPD-SocialNav:用于视觉语言社交导航的选择性 同策略 蒸馏
SOPD-SocialNav: Selective On-Policy Distillation for Vision-Language Social Navigation
摘要
通过利用对复杂环境和人类行为的丰富语义理解,视觉语言模型在社交机器人导航方面显示出强大的潜力。然而,大规模的 VLM 很难部署在资源有限的机器人平台上,而轻量级的 VLM 往往缺乏足够的社交推理能力。为了解决这个问题,我们提出了 SOPD-SocialNav,这是一种选择性 同策略 蒸馏 (SOPD) 方法,可将社交导航知识从大型教师 VLM 转移到轻量级学生 VLM。 SOPD 引入了一种基于熵的标记选择机制,该机制利用教师的不确定性来识别具有社会信息的决策标记,同时抑制与琐碎导航状态相对应的低熵标记的梯度。然后使用温度控制的 Jensen-Shannon 散度目标来对齐所选词元上的学生和教师分布。 SNEI 和 MUSON 基准测试表明,SOPD 在动作预测、感知一致性和推理一致性方面始终优于监督 微调、离策略 蒸馏 和标准 同策略 蒸馏 基线。 Scout Mini 机器人的实际部署进一步表明,经过提炼的模型可以在对话和排队场景中生成更适合社交的导航行为。这些结果表明,SOPD 是构建轻量级且具有社会意识的基于 VLM 的导航系统的有效策略。