论文

EAGLE-360:在 360$^\circ$ 中体现积极的全球到本地探索

EAGLE-360: Embodied Active Global-to-Local Exploration in 360$^\circ$

模型架构Transformer

摘要

虽然多模态 大语言模型 (MLLM) 在标准视觉理解方面表现出了卓越的能力,但将其用于 360$^\circ$ 全景环境中的主动视觉搜索却暴露了根本的局限性。具体来说,标准 MLLM 很难有效地模拟固有的全景特性,例如严重的极畸变和连续的圆柱拓扑,这会显着降低目标检测的精度。因此,现有的全景搜索方法试图通过严重依赖碎片化的局部视点来进行补偿。由于严格的初始化和缺乏全局全景先验的负担,这些方法面临着短视、低效的探索,并且在目标不在视野范围内时难以进行鲁棒的错误恢复。为了克服这些挑战,我们提出了 EAGLE-360,一种新颖的体现主动全球到本地探索框架。 EAGLE-360 不是执行详尽的本地搜索,而是利用全局先验来建立初始整体视角,迭代推理并逐步缩小搜索空间。在架构上,我们采用 RoPE Rolling(一种坐标移动位置编码机制)来无缝建模全景图的连续拓扑。为了促进这一范式,我们构建了大规模的 EAGLE-360 数据集,包括 14,000 多张 4K 全景图和 70,000 多轮高质量 VQA 对话。通过采用将监督 微调 (SFT) 与组相对策略优化 (GRPO) 集成的训练管道,我们有效地引发了复杂的空间推理和工具调用能力。大量实验表明,EAGLE-360 为 360$^\circ$ 视觉搜索建立了新的最先进技术,与基础模型相比,精度提高了近 8 倍,同时显着提高了探索效率。