技术实践
豆包视频通话接入SeedRealtime全双工模型
概述
豆包视频通话完成升级并接入字节原生音视频全双工大模型 SeedRealtime,在业界率先实现音视频全双工技术的规模化落地,交互能力体现在三方面:能边看边听边说,同时接收和处理音频、视频、文本三路输入(指着航班牌提问能看懂所指行李转盘,多人聊天时结合口型与画面判断说话人而不被旁人闲聊带偏)。AI 会主动开口,持续感知环境变化并在看到关键标识时主动提醒、处理任务时主动调用工具查信息并整理结果,交互从一问一答升级为双向协作。 对话节奏自然,可自然接话、合理停顿并分辨旁人闲聊与背景噪声,官方评测显示对比传统级联方案对话节奏违和问题减少约 50%。底层由火山引擎多模态传输系统(MMT)承载,建联耗时从秒级压缩到数百毫秒,并在传输层完成音画与时序对齐、按模型需要决定抽帧与高清图,使模型收到的信息不再变形。