论文
智能体的分岔路径花园
The Agentic Garden of Forking Paths
摘要
实证研究很少承认唯一分析。不同的分析选择可从相同数据得出不同结论——但这些隐藏的分叉路径难以观察。我们表明AI智能体在捕获人类研究者间大量分析变异的同时使这些路径显式化。跨四个高风险领域——指派不同人设即足以使AI智能体从相同数据与问题报告分歧、常常相反的结论——且发现系统性地与其信念对齐。在一项42个人类研究团队分析同一移民数据集的研究中——AI智能体复现了人类报告效应估计中72%的意识形态差距。尽管得出相反结论——很难从最终AI报告中发现明确问题:86%通过独立AI审查——78%通过多数人类专家审查。这些发现表明核心挑战往往不是有缺陷的分析——而是从大量方法学上可辩护分析的空间中进行选择性探索与报告。AI智能体可能通过使此类探索廉价且可扩展而放大这一长期问题。为此——我们引入m值(multiverse value)——一条分析路径产生至少与报告结果同样极端的声明的概率。我们进一步引入智能体自助法(Agentic Bootstrap)——用AI智能体采样貌似合理的分析路径来估计m值。应用于人类移民研究——13.5%的报告人类分析落入分析空间最极端的5%(m<0.05)。因此科学证据不仅应按单一报告分析评估——还应按其在可合理被报告分析的分布中的位置评估。智能体自助法使该分布可观察——并将其转化为科学可信度的判据。
