论文

RL-ADA:对抗性鲁棒企业对话代理的世界反馈框架

RL-ADA: A World-Feedback Framework for Adversarially Robust Enterprise Dialogue Agents

模型训练强化学习

摘要

在企我们提出了 RL-ADA(对抗性对话代理的强化学习),这是一种共同进化训练框架,它通过用 \emph{世界反馈} 替换人类标签来消除这一瓶颈:直接从可测量的交互结果中得出基于结果的奖励信号。客户支持代理(DA,3B 参数)和对抗性客户代理(CA,7B 参数)在固定自动法官指导下的对抗性竞技场中共同进化:DA 因正确处理多轮客户对话并成功解决问题而获得奖励,而 CA 因产生导致错误路由的现实的、意图隐藏的话语而获得奖励,通过对立但独立结构的奖励产生不对称的对抗压力。隔离健身房根据之前的失败记录迭代地重新训练较弱的智能体,在任何阶段都不需要人工注释。在银行客户支持概念验证中,工具路由错误被消除,严格的端到端通过率在五个共同进化周期中翻倍,仅由自动化竞技场奖励驱动,没有标记数据。我们还观察到 \textbf{Contextual Camouflage} 的出现,这是一种对抗策略,其中 CA 纯粹出于奖励压力而学习将意图嵌入到密集的现实客户细节中,这对企业红队和稳健性评估有直接影响。