论文

打破僵局:社会语言智能体的双尺度进化政策训练

Breaking the Impasse: Dual-Scale Evolutionary Policy Training for Social Language Agents

模型训练强化学习

摘要

虽然具有可验证奖励的强化学习(RLVR)已被证明对于封闭式任务有效,但通过自我对弈将其扩展到开放式社交语言游戏揭示了一个关键问题:进化僵局。由于巨大的策略空间,语言代理经常收敛于同质化行为,导致确定性匹配结果,从而消除了策略演化所需的梯度信号。为了解决这个问题,我们提出了针对社交语言游戏的双尺度进化策略训练(DEPT)。 DEPT 引入了一种时间尺度的进化感知机制,通过量化双尺度值基线分歧以及匹配熵来检测僵局。一旦察觉到崩溃,它就会激活不对称优势重塑,以动态调整优化景观进行干预。因此,我们的方法有效地恢复了梯度信号并实施持续的战略探索。对多种社交语言游戏的广泛实验表明,DEPT 的性能优于强大的基线,避免了策略退化并推动了社交语言代理的持续进化。