论文
MiniCPM-o 4.5:迈向实时全双工全模态交互
MiniCPM-o 4.5: Towards Real-Time Full-Duplex Omni-Modal Interaction
摘要
多模态 大语言模型 (MLLM) 的最新进展已将人工智能功能从静态离线数据处理提升到实时流交互,但距离人类水平的多模态交互仍有很大差距。关键瓶颈不再仅仅是模态覆盖或延迟,而是交互范式本身。首先,感知和响应仍然分为交替阶段,导致模型无法在生成过程中纳入新的输入以便及时调整。其次,大多数当前模型仍然是被动的,仅响应明确的用户请求,而不是在不断发展的多模式环境中主动采取行动。我们推出了 MiniCPM-o 4.5,这是我们在类人多模态交互方面的最新成果,它通过实时全双工全模态交互来缩小这些差距。它可以实时地看、听、说,同时还可以根据对现场场景的持续了解,表现出主动行为,例如发出提醒或评论。 MiniCPM-o 4.5 背后的关键技术是 Omni-Flow,这是一种统一的流媒体框架,可沿共享时间轴对齐全模式输入和输出。该公式将传统的回合制交互转换为全双工、时间一致的流程,从而实现同时感知和响应,并允许在同一框架内出现主动行为。 MiniCPM-o 4.5 共有 9B 个参数,在视觉语言功能方面接近 Gemini 2.5 Flash,在其规模上提供最先进的开源性能。它还在全模态理解方面超越了 Qwen3-Omni-30B-A3B,并提供更好的语音生成,并且计算效率显着提高。在高效的架构设计和推理优化的驱动下,该模型可以在边缘设备上以低于 12GB RAM 的成本进行实时全双工全模态交互。