论文

忠实却合谋:思维链监控为何无法单独防范定价智能体合谋

Faithful yet Collusive: Why Chain-of-Thought Monitoring Cannot Detect Collusion in LLM Pricing Agents under Oligopolistic Competition

模型评测安全与风险评测

摘要

作为自主定价智能体部署的大语言模型可能通过默契协调维持超竞争价格。我们建立因果图分歧框架,分别衡量伯特兰竞争中定价智能体的结构忠实性与意图忠实性。在九个大模型的双寡头和三寡头条件下,合谋行为与思维链忠实性在两个维度上都相互分离:合谋程度最高的模型准确报告合作意图,却在结构上不忠实地推理;结构最忠实的模型则在两种市场结构中均维持高于纳什均衡的价格。这些发现说明,仅靠思维链监控不能作为防止算法合谋的独立防护。