论文

数字万神殿:使用 LLM 代理模拟和审核联盟形成

Digital Pantheon: Simulating and Auditing Coalition Formation with LLM Agents

模型训练偏好优化

摘要

政治联盟的形成是一项复杂的谈判,由具体的政策目标和根深蒂固的意识形态信念驱动。虽然 大语言模型 (LLM) 为计算政治科学开辟了新的途径,但人类反馈强化学习 (RLHF) 灌输的中立性和助人性偏见阻止了它们维持坚定的党派行为。我们提出了一个多代理框架,通过结合监督 微调 (SFT)、直接偏好优化 (DPO) 和检索增强生成 (RAG),协调事实基础与意识形态一致性:DPO 灌输激进的特定政党角色,而每方 RAG 管道使每个代理都遵守其官方宣言。我们在 2019 年佛兰德斯选举中实施了该框架,在由一位组阁协调者仲裁的中心辐射式谈判中部署了党派智能体。为了使涌现出的谈判过程具有可解释性,我们引入了多层信息谱系拓扑(MILT),可将最终协议中的每一项条款追溯到其宣言起源,并将其分为五个来源状态;联盟影响力评分(CIS),可汇总这些可追踪的贡献,以确定是哪一方制定了协议;以及现实世界的基础通行证,将每个模拟条款与历史上采用的联盟协议进行基准比较。在三个独立的模拟中,该框架产生了稳定的获胜者和排名(N-VA 领先于 CD\&V 和 Open Vld),并且宣言锚定的血统可靠地预测了现实世界的物化,而幻觉内容却不能。其结果是一个透明的、可扩展的测试平台,用于事前探索各方兼容性和组阁协调者调解的妥协。