论文
EVLA:用于具有物理依据的驾驶推理和控制的电子感知多模式助手
EVLA: An Electro-Aware Multimodal Assistant for Physically-Grounded Driving Reasoning and Control
摘要
用于驾驶助理的现代视觉语言模型 (VLM) 通常将车辆动力学视为黑匣子,导致决策缺乏对车辆实时机电状态的了解。为了弥补这一差距,我们引入了电视觉语言助手(EVLA)——一种新颖的框架,它将多模式场景理解与电气化动力系统状态(例如电机扭矩、电池 SOC)的实时感知相结合。我们的方法具有两个关键创新:首先,统一共状态编码器(UCSE)将视觉、文本和车辆状态输入融合到共享的潜在表示中,并通过能源效率场进行增强以对空间能源成本进行建模;其次,电感知结构化推理链(ESRC),它用基于物理约束和优化目标的内部确定性推理过程取代外部思维链提示。 EVLA 通过物理引导的关节损失进行端到端训练,学会生成情境感知和能量最优的驾驶决策。对驾驶 QA 基准的广泛评估表明,EVLA 的性能大大优于强大的微调 VLM 基线,将最终分数提高了 +0.0871,准确性提高了 +5.6%。消融研究验证了每个组件的必要性,效率分析表明 EVLA 的推理速度比多级管道快 36%。这项工作强调,整合车辆状态意识和结构化物理推理对于开发下一代基于物理的驾驶助手至关重要。