论文

魔镜魔镜:VLM智能体到底能不能认出自己?

Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?

智能体系统Agent任务评测

摘要

在动物王国中,镜子自我识别是高阶认知的典型探索,仅在某些物种中出现。我们询问具身视觉语言模型(VLM)智能体中是否出现类似的功能能力:它们能在镜子中认出自己吗?我们引入了一个受控的 3D 基准,其中第一人称 VLM 代理必须从其反射中推断隐藏的身体属性并选择匹配目标,同时避免自我他人错误归因。为了将基于镜子的自我识别与捷径区分开来,我们测试了镜子移除、误导性线索和遮挡反射。我们还通过镜像搜索、时间顺序、自我归因和推理-行动一致性来评估决策过程。我们的实验表明,基于镜像的自我识别主要出现在更强的 VLM 中。这些模型可以使用反射的证据来采取行动,而较弱的模型经常检查镜子,但无法提取自我相关的信息或错误地归因其反射。语言与视觉的冲突进一步表明,自我指涉语言本身并不能证明扎根的自我认同。总体而言,基于镜像的评估提供了一个诊断,即体现的自我基础是否因果性地植根于感知和行动,而不是先验、即时顺从或虚构。

魔镜魔镜:VLM智能体到底能不能认出自己?:论文配图
图 1:镜像自我识别作为体现自我基础的测试。在不同物种中,镜子自我识别是有选择性地出现的:人类、大象和海豚可以利用镜子反射来指导自我导向行为,而其他动物则失败或依赖于更简单的策略。我们询问视觉语言模型(VLM)代理中是否出现了类似的功能。在我们的设置中,实体代理必须从镜子中推断隐藏的身体属性并采取相应的行动。成功不仅需要感知反射,还需要将其归因于自我而不是另一个实体。