论文

许多AI分析师,同一数据集:探索Agentic数据科学多元宇宙

Many AI Analysts, One Dataset: Navigating the Agentic Data Science Multiverse

智能体系统Agent任务评测

摘要

实证研究的结论不仅取决于数据,还取决于一系列分析决策,而已发表的结果很少明确说明这些决策。过去的“多分析师”研究已经证明了这一点:在同一数据集上测试相同假设的独立团队经常会得出相互矛盾的结论。但此类研究需要数十个研究小组之间数月的协调,因此很少进行。在这项工作中,我们表明,基于大语言模型(LLM)的完全自主的人工智能分析师可以廉价且大规模地重现类似的结构化分析多样性。我们要求这些人工智能分析师在固定数据集上测试预先指定的假设,在重复运行中改变基础模型和提示框架。每位人工智能分析师独立构建并执行完整的分析流程;然后,人工智能审核员会在涵盖实验和观察设计的三个数据集中筛选每次运行的方法学有效性。至关重要的是,效果是\emph{可操纵的}:即使在排除方法上有缺陷的运行之后,重新分配分析师角色或大语言模型也会改变结果的分布。

许多AI分析师,同一数据集:探索Agentic数据科学多元宇宙
图1:ANES数据集的规格曲线(specification curve)。上:每个点代表一份由AI分析师生成的分析,显示以电视新闻接触预测意识形态错位的标准化OLS系数,附95%置信区间。各分析按估计值排序;蓝色表示该分析支持假设,黄色表示不支持或结果不明确。各有效运行中的估计值横跨负向到正向效应。下:每次运行背后分析决策的Strike图。每行对应一个分析决策维度(在左侧标注)及其可能的类别(在右侧标注)。每列对应一次分析,其点估计显示在上方面板中。AI分析师在协变量数量、回归方法、标准误计算和时序汇总方式上各不相同,从单一研究问题产生了由多种可辩护规格构成的“多元宇宙”(multiverse)。