论文
全流思维
Omni-Streaming Thinking
摘要
流式全模态模型必须决定从迄今为止观察到的视频块和同步音频中回答什么以及何时回答。在话语或声音事件完成之前,视觉线索通常支持解释。如果这种解释作为事实进入记忆,即使音频与它相矛盾,后来的推理也可以继续传递它。我们将这种失败称为过早的跨模式承诺。我们提出全流思维(OST),它生成结构化输出,包括迄今为止观察到的证据、对未来证据的预测以及基于该证据的主张。每个索赔最初都标记为待处理,并链接到未来的验证间隔。音频和视频证据分开存储,OST 在验证间隔结束时根据指定方式的证据检查索赔。当检测到矛盾证据时,反驳过程会减少声明及其依赖状态的影响,然后使用新证据指导状态更新。答案门决定答案关键声明是否满足给出响应的条件。使用具有轻量级适配的冻结 Qwen3-Omni-30B-A3B-Instruct 主干网,OST 在五个流媒体和视听基准测试中的性能比最强的开放基线平均高出 10% 以上。我们还推出了 OST-DiagBench,它可以固定视频并编辑音频,以测试一致性、缺席、矛盾、共存和字幕语音冲突。 OST 达到 d-prime = 2.95,而开放基线最多为 1.38,同时减少了视觉引起的幻听。