论文

LLM主动对齐:纳什均衡视角

LLM Active Alignment: A Nash Equilibrium Perspective

智能体系统Agent 协作

摘要

我们开发了一个博弈论框架,通过纳什均衡(NE)分析来预测并引导大语言模型(LLM)群体的行为。为避免在开放式文本空间中计算均衡的不可处理性,我们将每个智能体的动作建模为对人类子群体的一个混合。智能体主动且策略性地选择与哪些群体对齐,由此得到一个可解释且在行为上有实质内容的策略类。我们推导出闭式的 NE 刻画,采用标准的凹效用假设以实现分析性的系统级预测,并为将对齐目标转向社会期望结果给出明确、可操作的指导。该方法可作为主动对齐层,叠加在 RLHF 等现有对齐流程之上。在社交媒体场景中,我们表明 LLM 群体——尤其是基于推理的模型——可能出现“政治排斥”这一病态,即某些子群体被所有 LLM 智能体忽视,而我们的方法可以避免这种情况,这说明了该方法在跨领域调控多智能体 LLM 动态方面的前景。

LLM主动对齐:纳什均衡视角
图1:跨模型与数据集的政治排斥(political exclusion)的代表性示例(完整结果见附录 C)。每个面板固定基础模型、数据集与子群体,并可视化该子群体在不同偏好系数下的内部纳什均衡权重。具体而言,β^(A)、β^(I) 与 β^(D) 中的一个系数被固定为 1,其余两个系数沿 x 轴与 y 轴变化(如图中所标注,采用对数刻度)。颜色表示分配给所考察子群体的均衡权重。权重低于 0.05 的区域以黑色标记,称为政治排斥区域(political exclusion area)。白色区域表示不存在内部均衡的参数取值。我们关注内部均衡,因为边界均衡必然将至少一个子群体的权重设为零,而我们的目标是理解如何避免政治排斥。