论文

SpeechGym:通过强化学习训练语音代理的音频原生健身房

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning

模型训练强化学习

摘要

语音代理必须完全通过语音调用工具并进行多轮对话,但主流范式是通过文本来训练它们。现有框架要么围绕专有语音 API 级联 TTS 和 ASR,其中梯度无法流动,并且每次调用的成本使得 同策略 强化学习令人望而却步,要么停留在文本中:它们测量语音代理但无法改进它们。我们提出了 SpeechGym,一种音频原生代理环境,其中两个全模态模型以原生音频进行对话,没有外部 ASR 或 TTS,也没有 API 边界,通过未修改的任务、工具和已建立的文本代理基准的成功检查,因此交互模态是唯一的变量,并且循环保持本地且可端到端训练。音频代理能力并不来自于音频理解。语音引入的失败是感知缺陷,而不是推理缺陷:代理选择了正确的工具和正确的参数槽,但用从波形中听错的值填充它,并且单个错误会级联成失败的调用、同一调用的重试和浪费的步骤预算。第二个失败是行为性的:在持续的呼叫者的作用下,代理执行未经授权的写入并结束事件,认为它有帮助。两者都是可训练的,因为环境免费标记它们:带有错误参数的调用对数据库失败,而正确的调用则成功。障碍是稀疏性,而不是信号。仅结果 GRPO 在这里梯度匮乏,因为几乎每个采样轨迹组都同样失败,而每轮流程奖励归功于每个成功的工具调用,可以恢复几乎每个组的差异。通过这种方式训练,代理无需进一步调整到独立实现的语音基准,任务成功率提高了一倍以上,并将开放权重模型从排行榜上的最后一位带到第二位,同时使用比训练前更少的回合和词元。