论文
Reading the Room:评测LLM理解群体规范的能力
Reading the Room: Foundations, Design, and Challenges of Normative Competence in LLMs
摘要
人类社区受到规范系统的管理:产生 \textit{norms} 的共享标准规定了可接受的行为,并通过社区制裁来强制执行。让日益自主的人工智能系统与这些规范保持一致是一项核心挑战,由于规范数量庞大、变化迅速且往往是任意的(例如着装或语言约定),这一挑战变得更加复杂。因此,一致性需要 \textit{规范能力}:能够仅从交互中辨别社区执行的规范,而不依赖于静态的预训练知识。我们引入了多智能体社区辩论设置,其中辩论的访问受到综合规范的控制,以研究与预训练暴露无关的规范能力。我们表明,基线 LLM 代理无法学习规范,即使这样做可以提高其准确性。然后,我们尝试各种 \textit{normative module}(规范推理的架构组件),发现规范遵循对规范的风格和驱动规范模块的模型都高度敏感,这表明 缺乏普遍性。此外,当特殊的、非规范的行为伴随着真正的规范时,LLM代理表现出非选择性的归因失败:他们不加区别地复制特殊的噪音和强制规则,即使模仿不必要的行为受到明确的惩罚,这种模式仍然存在。据我们所知,我们的工作是第一个对LLM的规范能力进行操作和评估的工作,表明当前的人工智能系统擅长行为模仿,但缺乏辨别社会强制秩序的能力。