论文
公共物品博弈中语言行为准则的对抗协同演化
Constitutional Arms Races in the Public Goods Game: Co-Evolving LLM Constitutions Under Cooperation-Defection Pressure
摘要
前沿大语言模型智能体在目标冲突的环境中可能进行勒索、破坏或文档泄露,暴露了围绕单智能体或合作假设设计的对齐方法的局限。已有工作说明,由大语言模型引导的演化搜索可以找到有效的合作行为准则,但对抗条件下仍有两个问题:适应度函数能否形成真正的对抗压力,以及语言模型的变异算子能否稳定服务于专门化的对抗目标。 本文在公共物品博弈(PGG)和空间网格环境中研究自然语言行为准则的对抗协同演化,让蓝方合作者与红方搭便车者演化 30 代。研究发现:一是 PGG 中两方在 S 约为 0.78 时接近平衡,该结果在所测的 1.2、1.5、2.0 和 3.0 倍乘数下保持稳定;二是分别对两方独立评分,会使双方结果近乎不相关,相关系数为 +0.088,无法产生对抗压力,而使用自身得分减去对手得分的适应度目标可以恢复这一压力;三是在纯对抗目标下,评测种子数量影响行为退化,K=2 时出现退化,K=5 时专门化行为维持了全部 30 代。结果表明,自然语言行为准则的对抗协同演化需要耦合的适应度与充足的评测预算;演化出的红队准则也可作为可解释的测试材料。