论文

CONSCIENTIA:LLM Agent可以学习制定战略吗?纽约市多代理模拟中的涌现的欺骗行为和信任

CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation

智能体系统Agent 协作

摘要

随着 大语言模型 (LLM) 越来越多地部署为自主代理,了解多代理环境中战略行为如何出现已成为一个重要的协调挑战。我们采取中立的实证立场,构建一个可以直接观察和衡量战略行为的受控环境。我们在纽约市的简化模型中引入了大规模多智能体模拟,其中 LLM 驱动的智能体在相反的激励下进行交互。蓝色代理的目标是有效地到达目的地,而红色代理则试图使用有说服力的语言将他们转移到广告牌密集的路线上,以最大限度地提高广告收入。隐藏的身份使导航以社交为媒介,迫使Agent决定何时信任或欺骗。我们通过迭代模拟管道来研究策略学习,该管道使用 Kahneman-Tversky Optimization (KTO) 在重复的交互轮次中更新代理策略。蓝色代理经过优化,可以减少广告牌曝光,同时保持导航效率,而红色代理则进行调整,以利用剩余的弱点。在迭代中,最好的蓝色策略将任务成功率从 46.0% 提高到 57.3%,尽管敏感性仍然很高,高达 70.7%。后来的政策表现出更强的选择性合作,同时保持轨迹效率。然而,持续的安全性与有用性的权衡仍然存在:更好地抵制对抗性指导的政策并不能同时最大限度地完成任务。总体而言,我们的结果表明,LLM 代理可以表现出有限的战略行为,包括选择性信任和欺骗,同时仍然非常容易受到对抗性说服的影响。