论文
体现 GPT-5.1:世界模型的证据?
Embodied GPT-5.1: Evidence of a World Model?
摘要
这项探索性研究检验了大型多模态语言模型 GPT-5.1 是否可以作为物理移动机器人的高级控制器,尽管没有事先的实施例、没有在模拟环境中进行训练、也没有接触过感觉运动经验。该模型仅使用低分辨率的第一人称图像和离散的动作集,负责导航和面向对象的行为,例如定位和联系目标玩具。在多项试验中,GPT-5.1 展示了空间推理和物理理解元素的新兴功能。其中包括在物体离开摄像机框架后保持物体位置的短期记忆,推断其自身运动的物理后果,以及执行连贯的动作序列,例如与物体碰撞和倒车以视觉验证结果。与此同时,该模型显示出效率低下和感知局限性,包括不精确的对齐策略和偶尔错误识别远处的干扰物。总体而言,结果表明,尽管没有任何与具身相关的训练,但 GPT-5.1 在具身环境中表现出了类似世界模型的行为迹象,这一发现挑战了认知科学和机器人学中的长期观点,即身体是发展这种形式的智能的必要先决条件。这些发现激发了对 大语言模型 物理理解的出现、限制和稳健性的更深入研究。