论文

提示优化使LLM智能体得以实现稳定的算法合谋

Prompt Optimization Enables Stable Algorithmic Collusion in LLM Agents

模型评测安全与风险评测

摘要

市场中的LLM智能体带来算法合谋风险。尽管已有工作表明LLM智能体能通过默契协调达到超竞争价格,现有研究聚焦于手工编写的提示。提示优化这一新兴范式要求发展理解自主智能体行为的新方法论。我们研究提示优化是否会在市场模拟中引发涌现性合谋行为。我们提出一个元学习循环:LLM智能体参与双寡头市场,一个LLM元优化器迭代地精炼共享的战略指引。我们的实验揭示,元提示优化使智能体能够发现稳定的默契合谋策略,其协调质量显著优于基线智能体。这些行为能泛化到留出的测试市场,表明发现了一般性的协调原则。对演化提示的分析揭示,协调通过稳定的共享策略以系统性机制实现。我们的发现呼吁进一步研究自主多智能体系统中的人工智能安全影响。

提示优化使LLM智能体得以实现稳定的算法合谋:论文配图
(a) 基线 LLM 代理 (b) 元提示优化 LLM 代理 图 1:与理论纳什均衡和垄断价格相比的定价和利润动态。两个子图分别显示了基线和元提示优化的 LLM 代理。每个子图显示两个值(价格和利润)和两个代理的 2x2 网格。