论文

OmniGAIA:迈向原生全模态 AI 智能体

OmniGAIA: Towards Native Omni-Modal AI Agents

智能体系统Agent任务评测

摘要

人类智能自然地将全模态感知——涵盖视觉、音频与语言——与复杂推理及工具使用交织在一起以与世界交互。然而,当前多模态 LLM 主要局限于双模态交互(如视觉-语言),缺乏通用 AI 助手所需的统一认知能力。为弥合这一差距,我们提出 OmniGAIA,一个综合基准,用于评估全模态智能体在需要深度推理与跨视频、音频、图像模态多轮工具执行的任务上的表现。OmniGAIA 通过新颖的全模态事件图方法构建,合成源自真实数据的复杂多跳查询,这些查询需要跨模态推理与外部工具集成。此外,我们提出 OmniAtlas,一个在工具集成推理范式下、具备主动全模态感知的原生全模态基础智能体。通过经后见引导树探索策略合成的轨迹训练并结合用于细粒度纠错的 OmniDPO,OmniAtlas 有效增强了现有开源模型的工具使用能力。这项工作标志着向面向真实场景的下一代原生全模态 AI 助手迈出一步。

OmniGAIA:迈向原生全模态 AI 智能体
图2:OmniGAIA 构建流水线。从带音频的视频以及图像+音频数据中,我们挖掘关键信号,构建并扩展工具增强的事件图,并通过事件模糊化生成经 LLM 与人工验证的多跳 QA。