论文

Pelican-VLA 0.5:在行动之前参加福利概括

Pelican-VLA 0.5: Attending Before Acting Benefits Generalization

模型架构Transformer

摘要

在本报告中,我们介绍了 Pelican-VLA 0.5,这是一种统一的 VLA 模型,它将视觉语言理解、未来帧生成和动作预测集成在单一架构中。 Pelican-VLA 0.5 实现了注意力级别的泛化:没有对象注释、分割掩模、注意力监督或特定于任务的 微调,其动作路径已经集中在与操作相关的对象和接触区域。这种行为在未见过的场景和未见过的机器人实施例中持续存在,并且比其他开源 VLA 基线要强得多。我们验证了这种能力源于插入感知和行动之间的可学习瓶颈词元:通过通过紧凑的瓶颈路由与任务相关的视觉信息,词元接口在 预训练 期间引起以操作为中心的注意力,并在不同的策略结构(包括 MoT 风格的架构)中保持有效。