模型

豆包实时语音模型 3.0(Seeduplex)API 上线邀测:全双工端到端,判停延迟缩短约 250ms、抢话比例下降 40%

豆包实时语音模型3.0 API 服务正式上线

应用与实践智能体系统Agent 工具调用语音交互与综合语音服务

概述

豆包实时语音模型 3.0(Seeduplex)为原生全双工端到端语音大模型,API 服务正式上线并开启邀测,具备三大能力:精准遵循——基于对用户指令的精准理解从被动响应走向适时参与,可持续倾听、自行判断对话节奏(例:一句「现在先别出声,聊到世界杯时再加入」即可安静待命,进入相关话题后再主动接话),并支持用户自定义工具,打通实时语音交互、任务规划与工具编排,使预定日历、发送邮件、总结文档、发起查询等可由一句话语音指令在对话流中直接调用工具完成;精准抗干扰——持续接收并理解用户侧音频以感知全局声学环境,区分交互声与背景噪音、旁人交谈、设备回声等干扰信息,在广播、导航、多人对话等嘈杂环境仍锁定用户声音,厂商口径称大幅降低误回复率与误打断率;动态判停——深度融合语音与语义理解识别表达完整性并对思考中的停顿保持耐心,评测显示相比半双工模型判停延迟缩短约 250ms、复杂场景下抢话比例下降 40%,用户主动打断时打断延迟缩短约 300ms。目标场景为汽车智能座舱、AI 智能硬件终端、智能呼叫中心与全渠道客服。