论文
隐藏信息社会演绎博弈中信念条件LLM智能体的审计
Auditing Belief-Conditioned LLM Agents in Hidden-Information Social Deduction Games
摘要
在隐藏信息多智能体设置中评估 LLM 智能体很困难:最终结果差异很大,并且很少揭示智能体为何做出这样的决定。我们在 9 人狼人环境中进行研究,其中代理在严格的代码级信息隔离下行动,我们构建了一个可审计的框架,该框架维护隐藏角色的外部信念状态,记录信念更新和信念行动偏差作为结构化证据,并支持防御性离线改进循环,在任何策略更改之前审查不良案例。在涵盖信仰禁用、积极信仰、内核消融、阵营限制、消费政策和高负荷组的 1,080 场冻结游戏中,包括种子配对 A0/A1 比较,积极信仰条件与更好的好方结果相关:在 200 种子 A0/A1 比较中,好方胜率从 0.205 上升到 0.390(配对) McNemar $χ^2 = 16.4$, $p < 0.001$),不可逆的巫毒错误较少。然而,我们并不将这种转变归因于信仰内容。直接的行动-信念一致性很低($\大约0.21$),并且仅向狼人提供信念比仅向好的一方提供信念对好的一方更有帮助,这与简单的持有者利益账户相悖;因此,我们将这种影响报告为一种关联,并将其机制视为尚未解决。贡献在于审计框架本身:它使效果可衡量,暴露了直接行动与信念的低一致性,用证据拒绝不可靠的强制消费干预,并将策略效果与负载混淆分开。因此,我们将高噪声隐藏信息游戏的外部信念主要定位为可审计的认知基线,该基线还携带决策相关信号,将不透明的代理行为转变为可重玩的证据,以实现更安全、受控的迭代。