论文
许多AI分析师,同一数据集:探索Agentic数据科学多元宇宙
Many AI Analysts, One Dataset: Navigating the Agentic Data Science Multiverse
摘要
实证研究的结论不仅取决于数据,还取决于一系列分析决策,而已发表的结果很少明确说明这些决策。过去的“多分析师”研究已经证明了这一点:在同一数据集上测试相同假设的独立团队经常会得出相互矛盾的结论。但此类研究需要数十个研究小组之间数月的协调,因此很少进行。在这项工作中,我们表明,基于大语言模型(LLM)的完全自主的人工智能分析师可以廉价且大规模地重现类似的结构化分析多样性。我们要求这些人工智能分析师在固定数据集上测试预先指定的假设,在重复运行中改变基础模型和提示框架。每位人工智能分析师独立构建并执行完整的分析流程;然后,人工智能审核员会在涵盖实验和观察设计的三个数据集中筛选每次运行的方法学有效性。至关重要的是,效果是\emph{可操纵的}:即使在排除方法上有缺陷的运行之后,重新分配分析师角色或大语言模型也会改变结果的分布。
