论文
魔镜魔镜:VLM智能体到底能不能认出自己?
Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?
摘要
在动物王国中,镜子自我识别是高阶认知的典型探索,仅在某些物种中出现。我们询问具身视觉语言模型(VLM)智能体中是否出现类似的功能能力:它们能在镜子中认出自己吗?我们引入了一个受控的 3D 基准,其中第一人称 VLM 代理必须从其反射中推断隐藏的身体属性并选择匹配目标,同时避免自我他人错误归因。为了将基于镜子的自我识别与捷径区分开来,我们测试了镜子移除、误导性线索和遮挡反射。我们还通过镜像搜索、时间顺序、自我归因和推理-行动一致性来评估决策过程。我们的实验表明,基于镜像的自我识别主要出现在更强的 VLM 中。这些模型可以使用反射的证据来采取行动,而较弱的模型经常检查镜子,但无法提取自我相关的信息或错误地归因其反射。语言与视觉的冲突进一步表明,自我指涉语言本身并不能证明扎根的自我认同。总体而言,基于镜像的评估提供了一个诊断,即体现的自我基础是否因果性地植根于感知和行动,而不是先验、即时顺从或虚构。
