论文
微调VLM用于增强人工智能的空间智能:理解 3D 和 2D 旋转
Fine-Tuning VLM for Enhancing AI's Spatial Intelligence: Understanding 3D and 2D Rotations
摘要
空间智能是科学、技术、工程和数学 (STEM)、医学、建筑和施工等多个领域的一项基本技能。最近的研究表明,视觉语言模型(VLM)在空间推理方面仍然面临局限性,这阻碍了人工智能(AI)执行实际的空间任务。使用为训练和评估开发的多个对象旋转数据集,我们的实验证明了 2D 和 3D 旋转检测方面的有希望的改进。经过微调的 Google DeepMind 构建的 Gemma-4 专家混合 (MoE) 模型在预测由轴和角度定义的旋转方面明显优于经过微调的 Gemma-4 通才模型。 微调还显着改进了 2D 表示的角度估计,而无需显式坐标系。此外,可识别物体并没有提高角度检测的准确性;相反,具有突出线性特征的物体表现出更好的性能。
