论文

VeriFuse:协作 3D 感知的有限视觉语言仲裁和理性引导细化

VeriFuse: Bounded Vision-Language Arbitration and Reason-Guided Refinement for Cooperative 3D Perception

模型推理推理验证与自校正

摘要

视觉语言模型(VLM)在不同的任务中表现出了强大的场景理解和语义判断,但它们在协作感知中的适当作用仍不清楚。直接要求 VLM 回归 3D 检测是不可靠的且计算成本昂贵,而使用它来选择单个源的输出会丢弃来自其他代理的有用信息。我们介绍 VeriFuse,一种用于车辆-基础设施协作 3D 检测的有界仲裁框架。每个代理首先独立生成检测结果。围绕每个车辆和路边提案,VeriFuse 生成源条件几何候选,并将原始检测、其扰动和跨源假设组合到统一的候选池中。然后,冻结的 VLM 在三个可接受的操作中进行选择: 选择合适的候选者;当支持一个对象但所有候选对象在几何上都不充分时,优化现有锚点;或 拒绝不受支持的仅基础设施提案。在 DAIR-V2X 数据集上的实验表明,VeriFuse 实现了 0.494/0.357 协作 3D AP50/AP70,并将 300 ms 延迟下的相对车辆端 BEV AP50 下降限制在 1.7%。总体而言,VeriFuse 为 VLM 在协作感知中赋予了明确且受约束的作用:语义推理解决了跨智能体假设之间的歧义,而确定性约束则决定了最终的 3D 几何形状。