论文
适用于室内环境的模块化视觉-语言-动作机器人框架
A Modular Vision-Language-Action Robotics Framework for Indoor Environments
摘要
本文提出了一个针对卡耐基梅隆大学视觉-语言-行动 (VLA) 挑战赛的集成系统,旨在使自主代理能够基于自然语言指令执行复杂的任务。我们的框架采用模块化架构来协调环境映射、问题处理和导航。该系统以两个并行流运行:一个感知管道,使用 OwlViT 嵌入从实时摄像机馈送构建语义体素图;另一个语言管道,使用视觉语言模型对用户命令进行分类。映射是有时间限制的;如果达到 500 秒的探索限制,系统将继续处理部分地图。然后,分类查询基于地图的几何和语义上下文,为 VLM 生成详细的提示。这会产生可操作的输出,展示了一种能够弥合人类语言和机器人动作之间差距的解决方案。