论文

战略代理策略的安全均衡策略优化

Safe Equilibrium Policy Optimization for Strategic Agent Policies

模型训练强化学习

摘要

通过强化学习进行微调的语言模型通常会针对任务奖励进行优化,而忽略多代理策略结构。因为这些智能体以自然语言游戏状态描述为条件,并通过自由形式生成发出行动,所以战略失败模式——利用较弱的对手、在有害的平衡上进行协调以及外部化成本与语言界面本身密不可分。我们提出了安全均衡策略优化(\sepo{}),这是一个训练目标,通过对可利用性、共谋风险和外部成本的明确惩罚来增加预期收益。我们实现 \sepo{} 作为组相对策略优化(GRPO)的奖励信号,在监督 微调 (SFT)后应用于 Gemma~4 E4B-it 和 Qwen~3.5-4B。评估五个战略领域:迭代囚徒困境、重复拍卖、两种谈判变体和库恩扑克。 \sepo{} 在 Kuhn Poker 中的两个模型都实现了零漏洞利用池优势,在四个领域的安全性上优于基本模型,并纠正了 SFT 引入的过度合作行为。在协商中,\sepo{} 实现了积极的安全结果,并且仅实现了任何协商配置的积极的标准化相对优势。消融实验证实,每次轨迹采样的漏洞利用计算是必要的:共享的常量惩罚取消了 GRPO 优势归一化(常量控制变量属性),产生零梯度。为了支持对代理战略安全的进一步研究,我们发布了 \href{https://anonymous.4open.science/r/sepo-2668/README.md}{code} 和 SFT 数据集。