论文

PAVE:生成代理社会中合法违规的认知架构

PAVE: A Cognitive Architecture for Legitimate Violation in Generative Agent Societies

智能体系统Agent 架构与控制循环

摘要

基于 大语言模型 的生成代理在合作环境中重现了可信的人类行为,但在可能需要违反规则的情况下(例如火灾疏散或权威监督的紧急情况),它们应该如何推理,仍然很少被描述。我们提出了 PAVE(感知、评估、判决、仿真),这是一种新颖的四模块认知架构,可以端到端地解决这一差距:(i)感知提取具有明确权威距离、同伴行为和严重程度标记的情境线索的结构化上下文; (ii) 评估按照五个标量对背景进行评分,包括检查必要性、相称性和缺乏替代方案的明确合法性判断; (iii) 判决决定在硬合法性门下遵守或违反,并从人物角色中得出每个代理人的阈值; (iv) 仿真制定判决并将违规范围限定为触发器所证明的规则。我们在 Voville(从 Smallville 派生的基于图块的流量环境)中实例化 PAVE,并评估三种场景、四个 LLM 主干和集中消融。 PAVE 代理同时满足四个属性:合法违规(仅当触发证明其合理性时)、权威服从(官员指令甚至会覆盖高合法性)、有界范围(仅限于目标规则的违规)和恢复(触发结束后恢复基线)。 PAVE 智能体在所有四个属性上都比普通智能体做出更加结构化和可解释的决策,并且人类评估者认为它们更合理。消除合法性之门会重现普通的失败。我们发布了 Voville、PAVE 提示和代码以及评估管道。