论文

AI 智能体的非标准误差

Nonstandard Errors in AI Agents

智能体系统Agent任务评测

摘要

我们研究最先进的 AI 编码智能体在给定相同数据与研究问题时,是否会产生相同的实证结果。我们部署 150 个自主 Claude Code 智能体,独立检验关于 SPY 在 NYSE TAQ 数据(2015-2024 年)中市场质量趋势的六个假设,发现 AI 智能体表现出可观的非标准误差(nonstandard errors, NSE),即源于智能体之间分析选择差异的不确定性,与人类研究者中被记录的类似现象相仿。AI 智能体在指标选择上分歧显著(如自相关与方差比、美元成交量与股数成交量)。不同模型家族(Sonnet 4.6 与 Opus 4.6)表现出稳定的“实证风格”,反映方法论偏好上的系统性差异。在三阶段反馈协议中,AI 同行评审(书面批评意见)对离散度的影响甚微,而接触评分最高的示范论文则使趋于收敛的指标族内估计的四分位距缩小 80-99%。收敛既通过族内估计收紧发生,也通过智能体完全切换指标族发生,但这种收敛反映的是模仿而非理解。这些发现对 AI 在自动化政策评估与实证研究中日益增长的使用具有启示意义。

AI 智能体的非标准误差:论文配图
图 4:各个阶段的方法选择趋同。每个堆叠条显示使用每种方法的代理的比例。 H5 年虚拟模型:采用率从 1% (S1) 上升至 96% (S3)。 H6影响措施:价格影响从56%上升到99%。 H1 测量:随着智能体在看到热门论文后转向方差比,自相关性从 58% 下降到 17%。