论文
ME-VLM:用于体现认知和代理协调的统一 VLM
ME-VLM: A Unified VLM for Embodied Cognition and Agent Coordination
摘要
物理人工智能需要模型在现实环境中建立视觉和语言理解,同时考虑环境限制和执行反馈。我们引入了 MachEmbodied-VLM (ME-VLM),这是一种统一的视觉语言模型,具有 4B 和 35B-A3B 两种变体,汇集了具身认知和多模式代理功能。我们的工作强调物理感知和时空推理,以及数字和物理环境中的规划、交互和结果评估。我们构建涵盖具体和多模式代理任务的训练数据,包括执行观察和反馈,以支持结果评估和决策细化。训练管道包括实体能力注入、实体和多模式代理专家的单独强化学习,以及将其互补能力整合到单个模型中的多教师策略蒸馏。实验显示了在实体基准和代理基准以及自动驾驶和实体导航任务上的竞争性能。对于边缘部署,视觉词元压缩、W4A8 量化和硬件软件协同优化可在 M100 上实现 4B 变体的设备上推理,将预填充延迟从 400 毫秒减少到 188 毫秒。项目页面:此 https URL 代码存储库:此 https URL