论文
以 5 Hz 思考,以 20 Hz 行动:闭环驱动的异步快慢视觉-语言-动作推理
Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving
摘要
大语言模型为端到端驾驶带来了指令跟踪和场景推理,但它们的推理延迟与车辆所需的控制速率相冲突。现有的闭环代理通过在交替的模拟刻度上调用模型并在其间重放上一个命令来隐藏这一差距,因此所有控制输出中有一半会忽略最新的观察结果。我们提出了一种快慢架构来消除这种妥协。冻结的 7B 视觉语言主干充当慢速系统,以低频消化导航指令和视觉历史记录,同时将其每层键值缓存暴露为场景的固定表示。轻量级动作专家充当快速系统,在每次模拟滴答时关注此缓存和当前相机帧,以在单个前向传递中回归航路点。由于缓存在部署方面落后于世界,因此我们在随机陈旧情况下训练专家,使训练与异步执行保持一致。在 CARLA 的 LangAuto-Short 路线上,我们的系统每 50 毫秒模拟刻度产生一次新的控制,并将路线完成度从跳帧基线的 37.0 提升到 94.0。同一位专家的跳帧消融将两个起作用的因素分开:专家自己提高了驾驶分数,而每次更新的新鲜度将完成度从 82.1 提高到 94.0,并将闯红灯违规次数减少了三分之一。在单个城镇上进行训练后,专家将零射击转移到两个看不见的城镇,保持 84-94% 的路线完成率,而基线达到 31-41%。与骨干网自己的动作头相比,它将开环路点误差减少了近四倍,每个刻度模型成本为 32 毫秒,与单个消费者 GPU 上的历史长度无关。