论文

Omni-o3:用于深思熟虑的视听推理的深度嵌套全模态推论

Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning

模型推理推理搜索与路径规划

摘要

全模态理解需要一个巨大的、高度冗余的跨模态交互搜索空间,需要集中和深思熟虑的推理。当前的推理范例依赖于顺序逐步生成或并行逐个样本采样轨迹,从而导致孤立的推理轨迹。这种无法共享有希望的中间路径的情况严重限制了探索效率,并导致复杂视听任务中的复合错误。为了打破这个瓶颈,我们引入了 Omni-o3,这是一种由深度嵌套演绎策略驱动的新颖框架。通过将推理表述为动态递归搜索,Omni-o3 本质上跨分支共享推理前缀,从而能够迭代执行四种原子认知操作:扩展、选择、模拟和反向传播。为了增强该框架的能力,我们提出了一个强大的两阶段训练范例:(1)在从 350 万个不同的全模态样本中提取的 101K 个高质量长链轨迹上冷启动监督 微调,从而实现必要的递归搜索模式; (2) 在 18K 复杂多轮样本上进行嵌套组采样轨迹驱动的探索性强化学习,由新颖的多步骤奖励模型明确引导以刺激深度嵌套推理。大量实验表明,Omni-o3 在 11 个基准测试中实现了具有竞争力的性能,解锁了综合视听、以视觉为中心和以音频为中心的推理任务的高级功能。