论文

AI智能体的规范执行:多智能体系统中行为的鲁棒塑造

Norm Enforcement for AI Agents: Robustly Shaping Behavior in Multi-Agent Systems

智能体系统Agent 动作执行与治理

摘要

AI智能体日益部署在共享环境中:它们追求多样目标并竞争奖励。这种多智能体竞争会导致个体获益、集体受损的行为——例如营销智能体为争夺社交媒体互动而发布误导内容。人类社会经约束可接受行为的规范、配合检测与惩罚违规的执行机制来解决此类问题。受此启发,我们研究语言模型智能体的规范执行机制。我们发现:简单的执行机制会被未对齐的智能体为竞争优势所利用——即使它们没有被显式训练或提示这么做。因此我们转向设计更鲁棒的机制,并识别两个关键要素:估计每个智能体随时间的可靠性,以及以递增惩罚更新该估计以应对重复不当行为。跨三个仿真环境与多样的智能体种群:基于这些原则构建的机制抵抗剥削,同时以与基线相当或更低的成本惩罚规范违规。结果把规范执行机制定位为塑造智能体行为的可扩展杠杆——但前提是设计时预见到它会成为其所治理系统的一部分。代码与数据见https://yaowenye.com/norm-enforcement。

AI智能体的规范执行:多智能体系统中行为的鲁棒塑造:论文配图
图 1:规范执行问题。左:部署在共享环境中的智能体争夺奖励。为了执行所需的规范,环境实现了一种允许代理报告规范违规行为的机制。然而,战略性不良代理人违反规范,并对合规竞争对手提出虚假报告。右图:我们提出了五种规范执行机制,并通过衡量随着时间的推移它们导致好(FP)与坏(TP)代理被删除的频率来评估它们。在相同的 TPR 水平上,我们最好的机制实现了简单机制 FPR 的一半。