论文
LLM主动对齐:纳什均衡视角
LLM Active Alignment: A Nash Equilibrium Perspective
摘要
我们开发了一个博弈论框架,通过纳什均衡(NE)分析来预测并引导大语言模型(LLM)群体的行为。为避免在开放式文本空间中计算均衡的不可处理性,我们将每个智能体的动作建模为对人类子群体的一个混合。智能体主动且策略性地选择与哪些群体对齐,由此得到一个可解释且在行为上有实质内容的策略类。我们推导出闭式的 NE 刻画,采用标准的凹效用假设以实现分析性的系统级预测,并为将对齐目标转向社会期望结果给出明确、可操作的指导。该方法可作为主动对齐层,叠加在 RLHF 等现有对齐流程之上。在社交媒体场景中,我们表明 LLM 群体——尤其是基于推理的模型——可能出现“政治排斥”这一病态,即某些子群体被所有 LLM 智能体忽视,而我们的方法可以避免这种情况,这说明了该方法在跨领域调控多智能体 LLM 动态方面的前景。
