论文

用于长上下文自动驾驶的规划一致的词元压缩

Planning-aligned Token Compression for Long-Context Autonomous Driving

摘要

整体视觉动作模型代表了自动驾驶的新兴范例。然而,在对复杂交互的扩展时间上下文进行编码时,这种架构生成的词元序列很快就会超出实时计算预算。虽然线性 Transformer 和外部存储器等方法试图使上下文变得轻量级,但词元压缩与架构最兼容,因为它不需要主干修改。然而,现有的压缩采用基于规则的启发式方法,例如时间衰减,与规划脱钩,存在丢失决策关键信息的风险。我们提出了 COMPACT-VA,这是一种基于条件 VQ-VAE 构建的与计划一致的工作记忆框架,将扩展上下文压缩为有界表示。压缩取决于历史轨迹和学习的规划意图,后编码器在训练期间从未来轨迹中提取,而先验编码器学习从压缩观察中预测它。压缩的内存与预测的潜在变量相连接,为端到端优化策略提供支持,并利用保留的决策关键信息进行规划。我们评估高信号动态场景,其中历史背景对于行为正确性(例如,停止、让步或继续)最为关键,并相应地设计行为指标。在可比较的 词元预算 下,我们的成功率提高了 6% 以上 (68.3%),并且各个指标的收益一致。消融验证了规划一致的耦合有效性。闭环评估证实,与未压缩处理相比,COMPACT-VA 保持了一般驾驶性能,加速速度提高了 3.3 倍,内存减少了 2.7 倍。