模型VLM³:Meta以标准视觉语言模型架构统一处理三维视觉任务的模型VLM³ 模型发布facebookresearch·来源日期:2026.05.07模型训练监督微调与指令调优收藏概述VLM³是Meta于2026年5月发布的三维视觉模型,代码位于facebookresearch/VLM3仓库。其做法是沿用标准视觉语言模型架构,通过文本式监督微调训练,把多种三维视觉任务统一到文本输出,覆盖物体级三维理解、度量深度估计、像素对应和相机位姿估计四类任务。相比为每类任务设计专用结构,统一建模简化了设计与工程接入,也便于复用VLM的预训练能力,详情见GitHub仓库。