论文

超越场景先验:具有基准测试和查询引导的小对象焦点的细粒度交通场景推理

Beyond Scene Priors: Fine-Grained Traffic Scene Reasoning with Benchmarking and Query-Guided Small-Object Focus

模型评测基准与评测资源

摘要

在安全关键的交通场景中,回答复杂的问题依赖于微小的、局部的视觉提示。然而,标准多模态 大语言模型 (MLLM) 往往会过度关注背景,在视觉语言对齐过程中压倒关键的小对象,我们将这种失败模式称为“关键证据稀释”。此外,现有的视觉问答(VQA)数据集很少暴露这个缺陷,因为它们缺乏需要精确定位本地证据的大规模、干扰因素较多的评估。为了弥补这一评估和架构差距,我们引入了细粒度流量推理基准 (FGTR-Bench) 和文本引导小对象推理 MLLM (TSR-MLLM)。 FGTR-Bench 包含通过多智能体生成、一致性检查和专家审核创建的 40,236 个单图像多项选择题 (MCQ),以及不相交的 4,947 个样本盲测试分割。为了解决证据稀释问题,基于 Qwen3-VL-4B 构建的 TSR-MLLM 使用查询条件文本引导小对象聚焦 (TG-SOF) 地图。在解码器边界应用一次,该映射将稀疏的 Top-K 门控残差添加到与问题最相关的视觉槽,同时保持文本标记不变。与轻量级解码器适配一起,TSR-MLLM 保留单通道推理,无需外部检测器或图像重新编码。在匹配设置下,TSR-MLLM 在 FGTR-Bench 上的表现比最强的 4B 基线高 2.1 个点(总体为 74.1%),在证据本地轨道上的增益更大。此外,在没有特定任务 微调 的贪婪解码下,它在 DriveQA-V(CARLA Signs)上仍然具有竞争力。