论文
Ex-Omni-2D:具备原生视觉出场的富表现力全模态对话模型
Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence
摘要
全模态对话模型能够理解多模态输入并合成语音回复,但语音回答仍使智能体在视觉上缺席。我们提出Ex-Omni-2D,一个以协调的文本、个性化语音和参考条件化视频来回答多模态查询的框架。对话模型先为场景、情感和动作编写结构化的视觉思维计划(Visual Thought Plan,VTP),然后生成回复文本和多码本语音单元。这些语音单元被解码为音频并与视频帧对齐,为语音与数字人模块提供共同的时间信号,同时允许二者从不同数据源学习。视频模块以全序列Teacher的形式训练,其条件包括参考外观、VTP语义和帧对齐的语音单元。我们进一步探索将其蒸馏为少步、块因果的Streaming Student;其Prefix Streaming机制将上一块干净的latent携带至下一块,并被分析为对后段主体漂移的部分缓解。在400×720/720×400分辨率下,四步、四GPU的Student能够以低于全序列Teacher的启动延迟提供增量输出。
