论文
OmniSeek:多轮视听推理的原生工具集成
OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning
摘要
我们推出了 OmniSeek,这是一个 Agentic 框架,可将 Omni 大语言模型 (Omni-LLM) 转换为使用本机工具的主动、多轮推理Agent。 OmniSeek 不是在一次前向传递中被动地处理整个视听序列,而是使证据获取成为推理过程的一部分:它动态地决定是看还是听,以及在哪个时间窗口上,以在长上下文中跨不同模式检索稀疏但关键的证据。通过迭代多轮协议,检索到的原始音频或视觉片段被附加回上下文中以支持后续推理。为了冷启动此功能,我们构建了一个综合 OmniTraj-170K 的数据引擎,这是一个带有交错音频和视觉证据的多跳思想链轨迹语料库。我们首先在这些轨迹上监督模型,以灌输多轮工具使用行为,然后通过具有可验证奖励的两阶段强化学习进一步优化策略。此外,我们引入了视听必要性目标,该目标明确奖励其推理依赖于两种模式的成功轨迹,而不鼓励单一模式的捷径。跨各种基准的大量实验表明,OmniSeek 可以学习自适应跨模式证据搜索,并持续提高视听推理性能。