论文
AI智能体的规范执行:多智能体系统中行为的鲁棒塑造
Norm Enforcement for AI Agents: Robustly Shaping Behavior in Multi-Agent Systems
摘要
AI智能体日益部署在共享环境中:它们追求多样目标并竞争奖励。这种多智能体竞争会导致个体获益、集体受损的行为——例如营销智能体为争夺社交媒体互动而发布误导内容。人类社会经约束可接受行为的规范、配合检测与惩罚违规的执行机制来解决此类问题。受此启发,我们研究语言模型智能体的规范执行机制。我们发现:简单的执行机制会被未对齐的智能体为竞争优势所利用——即使它们没有被显式训练或提示这么做。因此我们转向设计更鲁棒的机制,并识别两个关键要素:估计每个智能体随时间的可靠性,以及以递增惩罚更新该估计以应对重复不当行为。跨三个仿真环境与多样的智能体种群:基于这些原则构建的机制抵抗剥削,同时以与基线相当或更低的成本惩罚规范违规。结果把规范执行机制定位为塑造智能体行为的可扩展杠杆——但前提是设计时预见到它会成为其所治理系统的一部分。代码与数据见https://yaowenye.com/norm-enforcement。
