论文
Agentic AI 与结构化 CoT 增强人工智能的空间智能:旋转的可视化和推理
Agentic AI with Structured CoT for Enhancing AI's Spatial Intelligence: Visualization and Reasoning of Rotation
摘要
最近的研究表明,具有语言和视觉能力的人工智能(AI)在空间推理方面仍然存在局限性。在本文中,我们研究了高级生成式 AI 的空间能力,利用 AI 的图像处理和语言处理功能来理解 3D 空间中物体的旋转。我们训练并检查了生成式Agentic AI 模型 (GPT-5.6) 的空间智能,以基于修订版普渡大学空间可视化测试:旋转可视化(修订版 PSVT:R)通过旋转图了解空间旋转过程。我们通过叠加额外的图形和上下文特征来临时改进修订版 PSVT:R,以评估不同的思维链 (CoT) 推理策略如何影响模型性能。结果表明,结构化 CoT 推理提高了两个数据集(PSVT:R 和带坐标系的 PSVT:R)中基本 GPT-5.6 模型的空间推理性能。我们使用了三种 CoT 方法 - (1) 结构化 CoT、(2) 少量结构化 CoT 和具有自优化提示的结构化 CoT。本研究中评估的三种 CoT 方法没有表现出显着的性能差异。结果表明,将结构化 CoT 推理与相关上下文信息相结合,可以显着提高VLM在 3D 旋转任务上的性能,证明了Agentic AI 在更有效的空间推理方面的潜力。然而,当上下文信息被删除时,仅结构化 CoT 推理提供的改进有限,并且模型在理解空间变换方面继续表现出显着的困难。这些发现表明,VLM中的有效空间推理依赖于未来Agentic AI 系统中视觉、文本和基于推理的信息的集成,以实现空间智能。
