论文

Aero Realtime:面向低延迟流式多模态生成的全对齐输入输出流

Aero Realtime: Fully Aligned Input-Output Streams for Low-Latency Streaming Multimodal Generation

模型架构新型架构

摘要

现有流式多模态模型增量处理观测,但仍遵循基于回合的先预填充后解码模式,因而是非双工的:新观测无法自然进入正在进行的生成流。主动式替代方案使用微回合轮询或外部响应门控,会割裂连续交互、使响应时机与语言生成解耦,并使KV缓存友好的服务变得复杂。我们提出Aero Realtime,一个具有双工架构、面向实时生成的4B流式多模态模型。Aero Realtime将视频、音频与文本输出对齐到共享时间网格,其中每个约80毫秒的音频槽预测一个词汇token或静默token。这使输入与输出同步推进,让单一自回归目标同时学习何时响应与生成什么。推理时,Aero Realtime仅追加最新的多模态槽,延续先前的输出状态,并复用KV缓存实现高效增量执行。我们还提供完整的训练与服务配方,包括实时问答构建、槽对齐监督、硬件感知分布式训练与可恢复推理。在四块NVIDIA A6000工作站GPU上,Aero Realtime在20分钟连续流视频上保持84毫秒中位、173毫秒P95的处理延迟,与源时间线的偏差保持在200毫秒以内。这些结果证明了全对齐输入输出建模对双工、主动且与硬件对齐的多模态交互的可行性。

Aero Realtime:面向低延迟流式多模态生成的全对齐输入输出流:论文配图
图1:实时多模态架构:(a) 非双工的回合制生成;(b) 微轮次(micro-turn)轮询与外部门控;(c) Aero Realtime的对齐输入-输出流。