论文
SSP:用于自动驾驶 VLA 模型的事件匹配 Syn2Sim2Phy 跨域评估框架
SSP: An Event-Matched Syn2Sim2Phy Cross-Domain Evaluation Framework for Autonomous Driving VLA Models
摘要
自动驾驶的视觉-语言-动作(VLA)模型共同产生场景解释、基于语言的推理和驾驶轨迹。现有的评估通常使用独立选择的合成、模拟和物理数据,因此测量的性能差距可能会因场景内容的变化而不是真正的领域敏感性的变化而混淆。我们提出了 SSP(综合模拟物理),这是一种事件匹配的 Syn2Sim2Phy 评估框架,它将跨域比较锚定到相同的安全关键交互。从合成的长尾视频开始,SSP 构建了一个经过验证的事件规范,该规范保留了道路拓扑、参与者角色、相对运动、冲突演变、传递顺序、响应约束和事件阶段。然后,在 CARLA 和封闭的试验场上构建特定于平台的实现,并且仅在传输审核确认保留了强制事件属性后才进行评估。 SSP 将 OpenEMMA、LLaViDA 和 Alpamayo-R1 的异构输出映射到公共语义槽和 1 s 轨迹窗口中,以评估输出有效性、语义准确性、关键交互识别、轨迹质量和风险响应。在切入和弱势道路用户交叉口情况下,综合、模拟和物理领域的宏观平均综合 VLA 能力得分分别为 0.259、0.291 和 0.325,而最佳领域因场景而异。 Alpamayo-R1、OpenEMMA 和 LLaViDA 的得分分别为 0.405、0.338 和 0.131。 SSP 提供了可重现的场景传输链和 VLA 行为的证据合格评估,而无需假设物理域普遍优越。