论文

微调VLM用于增强人工智能的空间智能:理解 3D 和 2D 旋转

Fine-Tuning VLM for Enhancing AI's Spatial Intelligence: Understanding 3D and 2D Rotations

模型训练监督微调与指令调优

摘要

空间智能是科学、技术、工程和数学 (STEM)、医学、建筑和施工等多个领域的一项基本技能。最近的研究表明,视觉语言模型(VLM)在空间推理方面仍然面临局限性,这阻碍了人工智能(AI)执行实际的空间任务。使用为训练和评估开发的多个对象旋转数据集,我们的实验证明了 2D 和 3D 旋转检测方面的有希望的改进。经过微调的 Google DeepMind 构建的 Gemma-4 专家混合 (MoE) 模型在预测由轴和角度定义的旋转方面明显优于经过微调的 Gemma-4 通才模型。 微调还显着改进了 2D 表示的角度估计,而无需显式坐标系。此外,可识别物体并没有提高角度检测的准确性;相反,具有突出线性特征的物体表现出更好的性能。

微调VLM用于增强人工智能的空间智能:理解 3D 和 2D 旋转的原论文方法或结果图
图 1:Grasshopper 中旋转图像生成的工作流程