论文

通过高效轨迹生成进行 Alpamayo 1 的延迟分析和优化

Latency Analysis and Optimization of Alpamayo 1 via Efficient Trajectory Generation

模型推理推理加速

摘要

基于推理的端到端(E2E)自动驾驶最近成为一种提高驾驶决策可解释性的有前途的方法,因为它可以生成人类可读的推理和预测轨迹。此类方法通常会生成多个轨迹来捕获不同的未来行为,它们分为两类:(1)多重推理,其中每个轨迹生成一个推理序列;(2)单推理,其中所有轨迹共享单个推理。前者以冗余计算为代价提供了更丰富的多样性,而后者效率更高,但通常被认为会牺牲多样性。代表性系统Alpamayo 1采用多推理方法,实现了有竞争力的轨迹预测性能。然而,这种设计的效率在很大程度上仍未得到探索,这使其成为一个有充分动机的研究课题。在本文中,我们从两个方面系统地分析和改进了Alpamayo 1。首先,我们通过将 Alpamayo 1 重新设计为单一推理系统来减少推理延迟,同时保留轨迹多样性。通过大量的实验,我们发现用单一推理代替多重推理并不会显着降低轨迹多样性。其次,我们通过消除不必要的复制操作和低效的内核执行所产生的块间开销来加速基于扩散的动作生成。通过闭环和开环实验,我们验证了这两种优化,证明推理延迟减少了 69.23%,同时保持轨迹多样性和预测质量。这些结果凸显了联合分析系统架构和运行时执行对于提高基于推理的 E2E AD 系统效率的重要性。