论文

LLM 代理中可控意见动态的贝叶斯信念层

Bayesian Belief Layer for Controllable Opinion Dynamics in LLM Agents

智能体系统Agent 架构与控制循环

摘要

社会模拟中的大语言模型代理人在上下文中隐式地修改了他们的观点:代理人对说服的开放程度既无法指定也无法验证,并且集体结果继承了模型的先验训练。我们引入贝叶斯编年史代理(BCA),这是一个最小的信念层,将代理的信念与其所说的方式分开。每个立场都是一个概率,根据听到的每个话语更新一个贝叶斯步骤。单个先验强度参数 $\kappa$ 编码顽固性,以其在 Friedkin-Johnsen (FJ) 意见动态中的作用为模型。然后,我们扫描这个参数,根据需要产生意见动态的三个规范制度(共识、持续分歧、承诺少数影响力),持续分歧与 FJ 封闭式固定点匹配 $R^2\!=\!0.93$--$0.99$。我们进一步表明,规定的 $\kappa$ 在语言往返之后仍然可以恢复,并且所有四个模型都具有完美的排序恢复。明确的信念也使得模拟可审计:层表面系统性的每个模型的立场偏差,端到端模拟会默默地吸收。