论文
答案从何而来?自动驾驶多视图 MLLM 中视图级视觉证据识别的基准测试
Where Does the Answer Come From? Benchmarking View-Level Visual Evidence Identification in Multi-View MLLMs for Autonomous Driving
摘要
多模态 大语言模型 (MLLM) 在视觉推理基准上取得了很好的结果,但仅答案准确性并不能表明模型是否依赖于正确的视觉证据。这种差距在用于自动驾驶的多视图驾驶场景中尤其重要,其中模型可以在错误的摄像机视图中产生合理的答案。我们引入了用于评估证据源识别的多视图视觉问答基准:给定六个同步的 NuScenes 视图和一个问题,模型必须识别支持的摄像机视图并回答问题。该基准包含来自 73 个场景的 122 个以冲突为中心的问答对,涵盖因果关系、反事实推理和意图预测。视图标签由自动冲突挖掘管道提出,并由注释器手动验证。我们评估三种设置:摄像机视图选择、给出标准参考视图的提供标准视图的问答,以及模型一次性选择视图和答案的联合预测。答案以多项选择和自由格式两种形式进行评估,使用结构化预测的精确匹配和自由格式响应的 LLM 判断。通过明确地将视觉源识别与答案正确性分开,基准测试暴露了仅答案评估所遗漏的视觉证据定位错误。