论文

LLM智能体能否自动化文本转语音的强化学习?

Can LLM Agents Automate Reinforcement Learning for Text-to-Speech?

智能体系统Agent Harness

摘要

尽管强化学习(RL)后训练修复了零样本文本转语音(TTS)的局部分段错误,但达到工作方案仍然依赖于繁琐的手动调整,并且LLM智能体是否可以接管这个研究流程尚不清楚。我们使用AgenticTTS-Forge 来研究这个问题,这是一个协作工作流程,围绕共享工作空间构建人工指导和Agentic执行,应用于 CosyVoice2-0.5B。为了衡量智能体的自动化程度,我们根据已发布的配方逐步审核其轨迹。为了衡量它利用了什么,我们用隐藏在智能体中的留出观察者对其策略进行评分。我们的结果表明,智能体恢复了未指定的配方,对其进行了改进,并且当增益停滞时,会自动调查文献并从 LM 载体转向流动载体,将不良情况减少一半。然而,它的自主性在数据、代理和算法轴上暴露了三个陷阱:留出集合通过合约从未读取的通道进行泄漏,自形奖励使代理在得分处膨胀,单独调整的策略不会进行加法组合。这些发现表明,绑定约束是测量而不是推理,并且可以为Harness的设计提供信息,其合约读取智能体所做的每个通道。