Realtime-Venus:异步委托的全双工交互系统
Realtime-Venus: A full-duplex interaction system with asynchronous delegation
摘要
数字和物理环境中的自然交互需要持续感知和及时响应。口头对话依赖于声音和语言线索,而视频交互也需要将对话建立在不断变化的视觉环境中。我们推出了 Realtime-Venus,这是一种主动式全双工交互系统,具有两个单独训练的 9B 模型:用于视听交互的 Realtime-Venus-Omni 和用于语音交互的 Realtime-Venus-Audio。每个模型都充当完整的会话前端,通过用户输入、模型输出和委托事件的共享因果时间线集成连续感知、会话控制和本地语音生成。双循环运行时协调与后台推理和工具执行的实时交互。前台交互继续进行,而 Realtime-Venus-Harness 异步执行任务并返回结果以集成到正在进行的对话中。两种模型都遵循共同的训练后配方,结合了离线理解、主动全双工轨迹和委托工作流程。在评估的在线模型中,Realtime-Venus-Omni 在八个视频基准测试中的六个上取得了最高分,包括 StreamingBench (70.2%)、OVO-Bench (64.7%) 和 Daily-Omni (81.3%)。在八项音频理解和口语问答基准测试中,Realtime-Venus-Audio 在 MMAU (78.0%)、MMAU-Pro (63.2%)、Llama Questions (83.8%) 和 Speech CMMLU (67.8%) 上领先于比较模型,同时匹配最佳 VoiceBench AlpacaEval 分数 4.81。在 Full-Duplex-Bench v1.5 上,Realtime-Venus-Audio 可响应 75% 的用户中断,并在反向通道、其他定向语音和背景语音下分别实现 97%、88% 和 86% 的连续率,在所有三个连续指标上均超过 Gemini 3.1 Live 和 GPT-4o。