论文
Step-Audio-R1.5 技术报告
Step-Audio-R1.5 Technical Report
摘要
大型音频语言模型的最新进展已将思想链 (CoT) 推理扩展到听觉领域,使模型能够处理日益复杂的声学和口语任务。为了引发和维持这些扩展的推理链,在基于文本的推理模型的成功推动下,流行的范式在很大程度上依赖于带有验证奖励的强化学习(RLVR)。然而,随着模型经过严格优化,将丰富、连续的听觉环境提炼成孤立的、可验证的文本标签,一个基本问题出现了:我们是在培养真正的音频智能,还是仅仅将连续的感官媒介简化为离散的谜题?我们将其称为“可验证的奖励陷阱”。虽然 RLVR 在标准化客观基准上取得了显着的分数,但它系统地降低了音频模型的现实世界对话感觉。通过优先考虑孤立的正确性而不是声音的细微差别,RLVR 将动态交互简化为机械“答题机”行为,严重损害了韵律的自然性、情感连续性和用户沉浸感,特别是在长轮对话中。为了弥合机械目标验证和真正的感官同理心之间的差距,我们引入了 Step-Audio-R1.5,标志着音频推理中向人类反馈强化学习 (RLHF) 的范式转变。综合评测表明,Step-Audio-R1.5不仅保持了强大的分析推理能力,而且深刻改变了交互体验,重新定义了深度沉浸式长轮口语对话的边界。