论文
GroundLM 2026 上的 GroundSight 共享任务:GoldenViewVQA
GroundSight at GroundLM 2026 Shared Tasks: GoldenViewVQA
摘要
GoldenViewVQA 要求模型共同回答驾驶场景问题并识别包含支持视觉证据的摄像机视图,从而使精确的证据定位与答案正确性一样重要。我们提出了 \textbf{CoVeR-VQA},这是一种用于扎根多视图 VQA 的免训练多阶段验证和校正框架。从 GPT-5.6 零样本预测开始,CoVeR-VQA 逐步应用 Gemini-3.6-Flash 的视图特定验证、Claude-Opus-5 的先验引导联合验证,以及利用来自共享多视图场景和验证衍生先验知识的语义过滤问题组的交叉分割组级验证。在官方 GoldenViewVQA 测试集上,四阶段 CoVeR-VQA 管道实现了 84.75% 的联合精度,将 GPT-5.6 零样本基线提高了 13.56 个百分点,同时达到了 94.92% 的答案精度和 86.44% 的视图精度。经过两次额外的评估者通知的事后更正后,最终提交的运行达到了 88.14% 的联合精度。我们的分析表明,支持视图本地化 仍然是残余错误的主要来源,凸显了明确证据验证对于可靠的多视图多模式推理的重要性。