论文

智能体的分岔路径花园

The Agentic Garden of Forking Paths

应用与实践科学研究

摘要

实证研究很少承认唯一分析。不同的分析选择可从相同数据得出不同结论——但这些隐藏的分叉路径难以观察。我们表明AI智能体在捕获人类研究者间大量分析变异的同时使这些路径显式化。跨四个高风险领域——指派不同人设即足以使AI智能体从相同数据与问题报告分歧、常常相反的结论——且发现系统性地与其信念对齐。在一项42个人类研究团队分析同一移民数据集的研究中——AI智能体复现了人类报告效应估计中72%的意识形态差距。尽管得出相反结论——很难从最终AI报告中发现明确问题:86%通过独立AI审查——78%通过多数人类专家审查。这些发现表明核心挑战往往不是有缺陷的分析——而是从大量方法学上可辩护分析的空间中进行选择性探索与报告。AI智能体可能通过使此类探索廉价且可扩展而放大这一长期问题。为此——我们引入m值(multiverse value)——一条分析路径产生至少与报告结果同样极端的声明的概率。我们进一步引入智能体自助法(Agentic Bootstrap)——用AI智能体采样貌似合理的分析路径来估计m值。应用于人类移民研究——13.5%的报告人类分析落入分析空间最极端的5%(m<0.05)。因此科学证据不仅应按单一报告分析评估——还应按其在可合理被报告分析的分布中的位置评估。智能体自助法使该分布可观察——并将其转化为科学可信度的判据。

智能体的分岔路径花园:论文配图
图 1:基于角色的人工智能代理在四个科学问题上得出了不同的结论。 (a) 设置:相同的数据、问题和基础大语言模型;仅角色提示不同。 (b-d) 移民福利支持:(b) 42 个具有明确移民立场的人类研究小组 [4]; (c) 基于真实数据的人工智能代理; (d) 排列空数据上的人工智能代理。 (e) 咖啡有益于健康。 (f) 社交媒体对青少年心理健康的影响。 (g) 肠道 F/B 与 BMI 的比率。 Anti/Pro 面板显示签名效果(++ = pro/benefit;红色虚线位于 00);相信者/怀疑者小组显示||效果||。在人工智能代理小组中,每个点都是一次分析运行,通过了独立代理对主要方法错误的审查(137/160;方法)。