论文

CommandLM:自我车辆的数据驱动行为级别描述符

CommandLM: Data driven behavior level descriptor for ego vehicles

摘要

随着自动驾驶系统走向现实世界的部署,可解释的行为级决策对于安全、信任和监管至关重要。我们推出 CommandLM,这是一种多模式 大语言模型,它可以根据融合的多传感器数据为自我车辆生成简洁的、人类可读的行为描述。我们的模型通过连接到量化、LoRA 微调的 大语言模型 的 Q-Former 适配器处理来自 LiDAR 和多摄像头输入的临时融合鸟瞰视图表示。 CommandLM 在我们的 CommandLM-nuScenes 数据集上进行训练,生成适合规划者监督和安全审计的意图感知、可解释的行为描述。实验证明了强大的语言和行为一致性,达到了 CIDEr 0.67 和 BERT-F1 0.88,大大优于 BLIP-2 基线(CIDEr 0.52、BERT-F1 0.86)。在人工评估中,58% 的生成描述被评为准确、高效且符合规则,证实了它们在现实世界中的合理性。虽然其余描述可能并不总是选择最有效、面向目标的行为,但 CommandLM 的可解释输出使下游验证系统能够识别和纠正此类情况,使其成为透明行为审核的有效工具。这些结果表明,将多模态融合与语言推理相结合,可以为自动驾驶提供高效、透明的行为级理解。我们在以下位置发布代码和数据集:https://github.com/b-tok/CommandLM