论文
AI 智能体的非标准误差
Nonstandard Errors in AI Agents
摘要
我们研究最先进的 AI 编码智能体在给定相同数据与研究问题时,是否会产生相同的实证结果。我们部署 150 个自主 Claude Code 智能体,独立检验关于 SPY 在 NYSE TAQ 数据(2015-2024 年)中市场质量趋势的六个假设,发现 AI 智能体表现出可观的非标准误差(nonstandard errors, NSE),即源于智能体之间分析选择差异的不确定性,与人类研究者中被记录的类似现象相仿。AI 智能体在指标选择上分歧显著(如自相关与方差比、美元成交量与股数成交量)。不同模型家族(Sonnet 4.6 与 Opus 4.6)表现出稳定的“实证风格”,反映方法论偏好上的系统性差异。在三阶段反馈协议中,AI 同行评审(书面批评意见)对离散度的影响甚微,而接触评分最高的示范论文则使趋于收敛的指标族内估计的四分位距缩小 80-99%。收敛既通过族内估计收紧发生,也通过智能体完全切换指标族发生,但这种收敛反映的是模仿而非理解。这些发现对 AI 在自动化政策评估与实证研究中日益增长的使用具有启示意义。
