论文
人工组织
Artificial Organisations
摘要
对齐研究聚焦于让单个AI系统变得可靠。人类制度以不同的方式实现可靠的集体行为:它们通过组织结构来化解未对齐个体带来的风险。多智能体AI系统应当遵循这一制度模式,利用分隔与对抗性审查,通过架构设计而非假定个体对齐来获得可靠结果。我们通过 Perseverance Composition Engine——一个用于文档撰写的多智能体系统——展示这一路径。撰写者(Composer)起草文本,核实者(Corroborator)在可完全访问来源的条件下核实事实依据,批评者(Critic)则在无法访问来源的情况下评估论证质量:这是由系统架构强制实现的信息不对称。这形成了分层验证:核实者检测缺乏依据的论断,而批评者独立评估连贯性与完整性。对 474 个撰写任务(起草、验证与评估的离散循环)的观察呈现出与制度假说一致的模式。在被指派需要虚构内容的不可行任务时,这种迭代使其从尝试虚构逐步走向诚实地拒绝并提供替代方案——这种行为既未被指示、也未被个体激励。这些发现促使人们以受控方式研究架构约束能否由不可靠组件产生可靠结果。这使组织理论成为多智能体AI安全的一个富有成效的框架。通过将验证与评估实现为由信息分隔强制执行的结构属性,制度设计提供了一条让不可靠的个体组件产生可靠集体行为的路径。