论文
CrossTracer:通过 VLA 模型推理和跟踪残差自适应进行跨实施例导航
CrossTracer: Cross-Embodiment Navigation via VLA Model Reasoning and Trace Residuals Adapting
摘要
视觉-语言-动作(VLA)模型为机器人导航提供了强大的语义先验,但它们经常忽略特定于实施例的移动性约束。对于一个机器人来说语义上可行的路径对于另一个机器人来说可能是物理上不可行的。我们提出了 CrossTracer,这是一种通过自适应跟踪残差进行跨实施例导航的分层框架。 CrossTracer 将导航计划表示为标准化的图像平面路径点,在语义推理和物理基础之间形成统一的像素空间接口。首先,视觉语言跟踪提议器 (VL-Tracer) 采用预训练的 VLA 模型,根据以自我为中心的观察和灵活的目标规范来预测初始导航跟踪。其次,CE-Adapter 通过根据视觉可遍历性线索、机器人身份和初始轨迹预测实施例条件残差校正来细化该轨迹。为了在无需昂贵的手动注释的情况下训练细化模块,跨实施例 RRT* (CE-RRT*) 将全景分割转换为机器人调节的可遍历性成本图,并生成成本最小化的像素空间轨迹。我们在 NaviTrace 基准上评估 CrossTracer,该基准测试模型是否可以根据自我中心观察、语言指令和机器人体现类型生成体现一致的导航轨迹。 CrossTracer 的总分达到 45.68,比评估最强的通用基线 Gemini-2.5-Pro 提高了 10.01 分,相对提升了 28.1%。轮式和腿式机器人的实际部署进一步显示了导航成功率和执行效率的提高。