论文

StellaVLA:可泛化视觉-语言-动作模型的上下文结构化演示

StellaVLA: In-Context Structured Demonstration for Generalizable Vision-Language-Action Models

上下文与知识上下文工程

摘要

视觉-语言-动作 (VLA) 模型可以遵循指令并操纵对象,但当场景、视点或对象与训练不同时,它们的性能通常会超出分布 (OOD)。适应每种新情况通常需要收集更多数据和 微调。我们提出了 StellaVLA,这是一个框架,它通过对单个检索到的演示进行调节来在测试时进行调整。关键思想是超越模仿专家所做的事情,而是传达原因:自动化离线管道将每个原始轨迹转换为结构化演示,例如任务计划、子目标描述和语言化 3D 运动,且人工注释成本为零。作为上下文指导,这种结构化演示让策略对任务进行推理,而不是模仿像素轨迹,这也使得它可以跨实施例(真实机器人、人手或 XR 演示)进行转移。并行双训练设计通过联合动作和语言目标在训练过程中内化这种推理,而推理则单独使用动作专家,保持实时、高频控制,不会增加延迟。在 VLA-Arena 排行榜上(2026 年 8 月 1 日),StellaVLA 以 0.63 的总分排名第一,而强先验模型($π_{0.5}$ 和 LingBot-VLA)的总分分别为 0.44 和 0.22,并以 98.8% 的平均成功率进一步领先 LIBERO,以 85.1% 的成功率进一步领先 LIBERO-Plus。我们的真实机器人基准测试表明,StellaVLA 可以使用人类/机器人演示和人机 (XR) 演示作为上下文结构化演示,以帮助 VLA 模型适应 OOD 任务。