论文

OmniCoT:全局、多步全景推理的基准

OmniCoT: A Benchmark for Global and Multi-Step Panoramic Reasoning

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 已展现出有前景的空间推理能力,而这些能力在新兴的全景图像视觉模态中仍未得到充分探索。全景图的全360°×180°视场本质上支持复杂的全局多步推理,这也是全景图在体现智能等应用中的根本优势。然而,现有的全景基准主要集中于依赖局部线索或单步/少步推理的简单查询,从而忽略了全景的根本优势,未能充分发挥其潜力。为了解决这一差距,我们引入了 OmniCoT,这是一个全景空间推理套件,旨在使 MLLM 能够使用全局证据并跨视点执行多步推理。它包括用于评估的 OmniCoT-B(6.7K 数据),可测量答案准确性和推理质量,以及 OmniCoT-Real(1K 数据)作为手动注释的现实世界子集,以量化 Sim-to-Real 差距。对于训练,OmniCoT-T(14.3K 数据)是专门构建的,具有结构化的逐步思想链注释,可将中间推理步骤与全景证据明确联系起来。基于 OmniCoT-T,我们引入 OmniCoT-R1,并采用针对几何复杂全景空间量身定制的两阶段训练策略,其中监督 微调 (SFT) 将推理锚定到全景证据(例如方位、邻近度),GRPO 惩罚几何不相干路径以巩固全局 360° 空间一致性。通过 OmniCoT,我们的目标是重新校准全景空间推理的难度,以更好地与全景图像的内在功能相结合,从而促进该研究领域取得有意义的进展。