论文
StepAudio 3 实时技术报告
StepAudio 3 Realtime Technical Report
摘要
实时语音交互需要深刻的推理、迅速的反应和流畅的轮流转换。我们推出了 StepAudio 3 Realtime,这是一种围绕连续的聆听-对话-思考-行动循环组织的音频语言基础模型。深度感知捕获丰富的声音线索来解释用户意图,而无缝双工模型同步音频流以自然地处理暂停、反向通道和中断。至关重要的是,我们通过“说话时思考”解决了深思熟虑和延迟之间的紧张关系,在口头表达的同时执行私人推理。在推理模式下,StepAudio 3 在 StepAudioChat 上的宏平均值达到 73.0。通过“说话时思考”,它可以在实时说话时实现与专用推理模型相当的对话和推理性能。此外,集成的语音代理可以处理异步工具执行,而不会中断对话流。 StepAudio 3 Realtime 在关键维度上实现了顶级性能:MMSU 基准测试得分为 90.6,人工分析全双工基准得分为 98.9,$τ$-Voice 的宏观任务成功率为 56.0%。