论文

太空中的自我:无人机体现智能中自我意识和空间认知的基准测试

Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence

模型评测基准与评测资源

摘要

自主无人机系统越来越依赖多模式 大语言模型 (MLLM) 在复杂的现实环境中运行。这种具体场景不仅需要理解周围的空间,还需要保持代理本身的连贯表示。然而,现有的面向无人机的方法和基准仍然很大程度上以环境为中心,主要关注空间理解任务,而智能体的自我意识仍然是隐含的。为了解决这一差距,我们引入了 SIS-Bench,这是一个在统一的自空间公式下评估无人机场景中的体现空间智能的基准。 SIS-Bench 沿着两个互补的维度(空间和自我)以及感知、记忆和推理的三级层次结构来组织评估。它包含 13 个任务中的 4,856 个问答对,这些任务是通过经过专家验证的任务条件构建管道从 1,646 个真实无人机视频中衍生出来的。广泛的评估表明,当前的 MLLM 在建模动态和以代理为中心的流程方面表现出根本的局限性。特别是,我们观察到空间认知和自我意识之间存在明显的不平衡,以及认知水平的逐渐下降。受这些发现的启发,我们进一步探索了一种运动感知表示,通过光流和视觉特征融合结合了自相关动力学。实验结果表明,建模代理运动不仅在空间认知方面而且在自我意识方面持续提高感知和记忆性能,并推广到下游无人机决策任务。我们的结果强调了自我意识对于推进具身空间智能的重要性,并为运动感知自我空间建模提供了新的基准和经验证据。