论文
通过使用 V-JEPA 将语义与字幕生成解耦来理解模拟到真实的交通场景
Sim-to-Real Traffic Scene Understanding by Decoupling Semantics from Caption Generation with V-JEPA
摘要
2026 年人工智能城市挑战赛的第二轨道需要在具有挑战性的合成到真实领域转换下进行视觉问答 (VQA) 和交通事件描述生成。现有的视觉语言方法经常将语义理解与语言生成纠缠在一起,使它们容易产生幻觉和跨事件阶段的不一致推理。在这项工作中,我们提出了一个解耦的语义理解框架,该框架首先将预定义的流量问题解析为结构化语义事实,然后使用这些事实来指导字幕生成。冻结的 V-JEPA 编码器提取预测场景表示,而基于 Llama 的轻量级预测器为 VQA 查询生成答案。为了提高可靠性,我们引入了一种免训练的结构化细化机制,该机制利用统计先验、问题间关系和时间事件一致性来纠正预测错误。然后将精炼后的语义事实提供给 Qwen3-VL-8B,以生成每个交通事件的行人和车辆描述。在2026年AI城市挑战赛Track 2官方基准测试上的实验结果表明,该方法的VQA准确率达到87.09%,S2总体得分为60.0853,在所有参赛队伍中排名第一。这些结果表明,预测世界表示与结构化语义细化相结合,可以实现更准确、更可靠的流量理解,从而生成更高质量的语言。