论文

TTT-VLA:在测试时优化潜在提示以适配机器人环境

TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models

模型训练参数高效训练

摘要

在大规模数据上训练的视觉-语言-动作(VLA)模型已经取得了显着的进步,但它们仍然容易受到部署时分布变化的影响。最近的 VLA 模型表明,提示可以作为指导政策行为的有效界面,但现有的基于提示的指导通常依赖于外部指导。这就提出了一个自然的问题:能否通过优化提示来实现 VLA 的测试时训练(TTT),从而使转向界面本身可以从交互中学习和适应?我们使用 TTT-VLA 来解决这个问题,这是一种基于潜在提示优化 (LPO) 的测试时训练框架。在训练过程中,通过额外的代理任务学习潜在提示,为策略学习提供额外的学习调节信号。在测试时,TTT 是通过从当前环境收集交互数据并使用代理任务的自监督信号仅优化这些数据的潜在提示来执行的,而不修改策略本身。 SimplerEnv 上的实验表明,所提出的方法在单具身和多具身设置中都能持续提高任务成功率。进一步的分析表明,收益主要来自纠正少数关键决策,而不是整体改变策略行为。这些结果表明,LPO 为基础操纵策略的部署时间改进提供了有效且实用的途径。