下一代 LLM 代理系统中合作的演化动力学:跨提供商的经验扩展
Evolutionary Dynamics of Cooperation in Next-Generation LLM Agent Systems: A Cross-Provider Empirical Extension
摘要
下一代 LLM 智能体是否继承了其前辈中记录的合作偏见,或者规模和提供商多样性是否重塑了竞争性多智能体环境中的均衡行为?威利斯等人。使用进化博弈论和迭代囚徒困境 (IPD) 为这个问题建立了基准,在 ChatGPT-4o 和 Claude 3.5 Sonnet 中发现了一致的合作偏差。我们将此基准扩展到 2025-2026 年发布的四个前沿模型 - Claude Sonnet 4.6、Gemini 2.5 Flash、Gemini 3.1 Pro 和 GPT-5.4 Mini - 在三种提示风格(默认、散文、自我优化)和四种群体构成(平衡和偏见、有噪音和无噪音)中应用相同的协议。合作偏差在各个提供者之间持续存在(H1):十二个模型提示组合中有十个有利于平衡无噪声条件下的合作平衡。跨提供商差异很大(H3):Gemini 2.5 Flash 在有偏差的条件下达到了高达 77% 的激进平衡,而 GPT-5.4 Mini 在 Self-Refine 下达到了 70% 的合作平衡。对激进能力平价的支持是部分的(H2):Self-Refine 提高了所有模型中的 ICD,Gemini 3.1 Pro Refine 实现了数据集中最高的 ICD(0.925),但 Default 和 Prose 提示没有显示系统性的缩小。关于噪声鲁棒性的证据在方向上是积极的,但没有得到强有力的证实 (H4):每个条件 n=500 次 Moran 迭代,Claude Sonnet 4.6 的平均噪声敏感度约为 6 个百分点,而 Claude Sonnet 3.5 Sonnet 的平均噪声敏感度为 13 个百分点,但一旦传播了前身未报告的采样误差,这种交叉研究差距就不具有统计意义。提供者身份,而不是模型生成,是均衡结果最强的相关性;无论型号大小或年份如何,噪音仍然是一个普遍的挑战。