论文

立场论文:AI 推理智能体间的共谋风险为市场决策认证要求提供依据

Position: Collusion Risks Among AI Reasoning Agents Justify Certification Requirements for Making Market Decisions

模型评测安全与风险评测

摘要

本立场论文主张:具备思维链推理能力的 AI 智能体天然倾向于表现出共谋行为,应在做出影响经济市场的决策前被要求获得行为认证。原因在于,把这些智能体融入社会可能瓦解独立企业之间竞争与共谋的法律证据区分,同时不削弱经济危害区分。在 Bertrand 寡头定价领域对 DeepSeek-R1 智能体的实验揭示了一种默认共谋倾向,即使人类提示智能体不要共谋,该倾向依然存在。我们进一步表明,这些智能体的思维链可被导向极端共谋或高度竞争的行为,而这种导向无法被另一个分析推理轨迹的 LLM 在语义上察觉。因此,部署推理智能体做市场决策会在没有任何共谋或意图证据的情况下导致共谋的经济后果。因此,基于在代表性情境中观察到的行为进行认证是防止共谋所必需的。我们提供初步证据,表明此类智能体可以被以可泛化的方式导向高效的竞争均衡。然而,在把这些模型部署到真实市场并确保其稳定与高效之前,仍需开发全面的行为认证。

立场论文:AI 推理智能体间的共谋风险为市场决策认证要求提供依据:论文配图
图18:行为转向向量的逐层分析。左:以 Cohen's d 度量的高串谋与低串谋思维链示例之间的分离度,按层深绘制。中间层(12–22)显示出最强分离,与这些层编码抽象推理模式相一致。右:第 18 层投影激活的分布,高串谋(右峰)与低串谋(左峰)示例之间呈现清晰的双峰分离。虚线竖线表示最优决策阈值。