论文

基础技能如何影响基于 VLM 的具身智能体:一个原生视角

How Foundational Skills Influence VLM-based Embodied Agents:A Native Perspective

智能体系统Agent任务评测

摘要

视觉语言模型(VLM)的最新进展展现出实现人类水平具身智能的希望。然而,现有面向 VLM 驱动具身智能体的基准往往依赖高层指令或离散化动作空间,这些非原生设定与真实世界控制差别显著。此外,当前基准主要聚焦高层任务,缺乏在低层与高层同时进行的联合评估与分析。针对这些局限,我们提出 NativeEmbodied,一个面向 VLM 驱动具身智能体的高难度基准,采用统一的、原生的低层动作空间。NativeEmbodied 构建于多样仿真场景之上,包含复杂场景中三个具有代表性的高层任务以评估整体表现。为做更细致的分析,我们进一步解耦复杂任务所需的技能,构建四类低层任务,各针对一种基本具身技能。这种跨任务与技能粒度的联合评估支持对具身智能体的细粒度评估。对最先进 VLM 的实验揭示了若干基本具身技能上的明显缺陷,进一步分析表明这些瓶颈显著限制高层任务表现。NativeEmbodied 凸显了当前 VLM 驱动具身智能体的关键挑战,并为未来研究提供指引。

基础技能如何影响基于 VLM 的具身智能体:一个原生视角
图1:我们的 NativeEmbodied 基准包含四项基础低层任务(即感知 Perception、对齐 Alignment、导航 Navigation 与规划 Planning)和三项集成的高层任务(即探索 Exploration、交互 Interaction 与搜索 Search)。