论文
用于零样本 3D 理解的代理协作认知
Agentic Collaborative Cognition for Zero-Shot 3D Understanding
摘要
最近的进展通过使用多模态 大语言模型 (MLLM) 将其重新表述为视频关键帧理解,探索了代理零镜头 3D 理解。然而,由于视频中固有的有限观察视角和 3D 场景的隐式感知,现有方法面临着内在的瓶颈。在本文中,我们提出了一个协作多智能体框架,该框架分配一个规划智能体来处理高级视点规划并补充新颖的视角,并分配一个感知智能体将 3D 场景明确地总结为结构化的整体认知图。具体来说,规划代理首先分析这个认知图,以确定与查询相关的观点,并补充缺失的关键观点,以确保全面的观察。随后,感知代理通过跨视点分配一致的实例标识符来记录这些视图中的对象级属性,从而将碎片观察整合到整体认知图中。同时,它提供反馈以过滤掉不匹配的候选对象并指导后续的视点规划。通过这个闭环迭代过程,两个代理协作找出候选者,直到感知代理确定已捕获足够的信息来完成任务。大量实验表明,我们的方法在 6 个基准测试中实现了最先进的性能,在 ScanRefer 上提高了 11.1% Acc@0.5,在 3D 辅助对话上提高了 14.6 BLEU-1,在 SQA3D 上提高了 2.1 EM。