论文
ASCII Art 将 LLM 转变为 VLA 控制器
ASCII Art Turns LLMs into VLA Controllers
摘要
视觉-语言-动作(VLA)控制器通常是通过扩展具有动作监督的视觉-语言模型(VLM)来构建的,依赖于具有大数据和计算要求的多模式骨干网。我们证明,当使用 ASCII 表示将视觉观察结果呈现为文本输入时,纯文本 大语言模型 (LLM) 可以适应 VLA 样式控制器。这种 ASCII-as-vision 接口使 LLM 的现有训练和部署堆栈能够有效地调节视觉状态,遵循自然语言指令,并生成受约束的可执行操作。我们使用基于规划的教师的专家演示以及用于迭代改进的 DAgger,对跨模型系列和规模的多个 LLM 和 VLM 进行微调和比较。在 2D 操纵基准中,在模拟和物理操纵器上,生成的控制器可以识别与任务相关的实体并规划可行的动作序列。我们的结果表明,ASCII 渲染可以作为从图像到文本的轻量级、可解释的模态桥梁,补充传统的 VLA 管道,并为纯文本主干的 VLA 研究开辟方向。