论文

12愤怒的AI陪审员:以电影式陪审团评议评估多智能体LLM决策

12 Angry AI Agents: Evaluating Multi-Agent LLM Decision-Making Through Cinematic Jury Deliberation

智能体系统Agent任务评测

摘要

如果Sidney Lumet《十二怒汉》(1957)中的十二名陪审员不是人而是大语言模型会怎样?那位持异议的陪审员还能改变所有人的想法吗?该论文将这一场景实例化为LLM评议的多智能体基准:十二个智能体各自按忠于电影的人设设定,用多智能体框架辩论片中的谋杀案。测试了代表RLHF光谱两端的两个模型:GPT-4o(闭源、重对齐)与Llama-4-Scout(开放权重、轻对齐),跨三种条件(基线、开放思维提示、无初始投票),每格N=3次重复(共18次运行)。得到三个发现。(i) 十八次运行中十七次以陪审团僵局告终(未能达成一致裁决);影片的核心事件——少数派逐渐说服多数派——几乎从不发生,说明锚定是当前LLM在此 setting 中的主导失败模式。(ii) 两个模型呈现截然不同的内部动力学:GPT-4o在所有条件下平均每次运行1.0次投票改变,而Llama-4-Scout从2.0(基线)到6.0(开放思维提示)不等,且是唯一达成NOT_GUILTY裁决的模型(无初始投票条件3次中的1次)。同一条「开放思维」指令被Llama内化、被GPT-4o忽略。(iii) 这种不对称提示:在多智能体 setting 中,决定评议灵活性的主要因素是RLHF对齐训练的强度,而非模型能力。追踪人类评议的是灵活性而非能力。该工作定位为探索性研究,并讨论其对LLM陪审团评估与多智能体辩论的启示。