不是一个整体:中国前沿LLM智能体合作均衡的实验室水平分歧
Not a Monolith: Lab-Level Divergence in the Cooperative Equilibria of Chinese Frontier LLM Agents
摘要
西方前沿 LLM 智能体记录的合作偏见是否会延伸到不同的阵营谱系,体现它的中国模型是否应该被视为一个整体或不同的实验室?我们在进化迭代囚徒困境中研究了四种前沿的中国模型 - DeepSeek V4 Pro、Qwen3-Max、Kimi K2.5 和 GLM-5.1,其设计消除了先前工作中存在的混淆。我们没有让每个模型将自己的自然语言策略转换为代码,这将策略部署与编码能力纠缠在一起,而是在所有实验室中保持固定的转换器(GPT-5.4 Mini),因此每次跨实验室比较都是单独一代的比较。我们运行完整的协议:所有比赛和莫兰过程,每个条件 n=500 次运行,跨越三种提示风格和四种人口制度。评估两个预先注册的假设。支持 H6(非整体式):四个实验室在激进平衡比例方面存在显着差异,P_A 从 Qwen3-Max 的 1% 到 DeepSeek V4 Pro 的 9%,其中六个成对比较中的四个在 Holm-Bonferroni 中幸存。四个实验室的分布(P_A范围8pp)大于中国和西方生态系统平均P_A之间的差异(5.0% vs 5.0%):以此衡量,生态系统内的差异超过了东西方的差距。 H5(合作偏向普遍性)是一致的,但也是合格的:合作多数在 12 个实验室提示组合中的 6 个中成立,而西方模型报告的 12 个组合中只有 9 个成立,我们并不认为这种差异是牢固的,因为计数依赖于合作中立的近关系,并且在我们预先注册的稳健性检查中的替代转换器下上升到 9/12。实验室,而不是生态系统,是设定合作处置的单位;将“中国模式”视为一个整体是没有证据支持的。