论文

AdaptDuplex:从静态到自适应全双工语音对话

AdaptDuplex: from static to adaptive full-duplex spoken dialogue

模型推理解码与生成控制

摘要

全双工口语对话需要在时刻变化的对话时间和认知需求下以亚秒级延迟同时听和说。然而,当前的模型大多强加静态操作点,缺乏自适应决策的系统机制。我们推出了 AdaptDuplex,它通过这样的机制升级了 Qwen3-Omni,跨三层共同设计。紧凑的词元级协议将每个窗口表示为规范序列,通过有界文本引导语音来训练双流对齐,并通过 logits 偏差将每个行为决策公开为用于免训练运行时控制的显式词元。自适应机制动态预测离散窗口持续时间,并根据需要通过非阻塞认知巩固和多飞行外部推理增强直接响应。渐进式管道通过三阶段的 Thinker 课程引入这些行为,然后是仅 Talker 和联合 SFT,并以 GRPO 作为进一步的增量。在 Full-Duplex-Bench v1 和 v1.5 上,AdaptDuplex 在大多数可比较的轮流、重叠行为和计时指标上均优于 DuplexOmni 和 MiniCPM-o 4.5,并且在交互决策和响应计时方面都有所提高。在人工记录的 HumDial-FDBench 上,它获得了比较双工模型的最高最终得分 (72.9)。