论文

通过Agentic假设生成与实验加速社会科学研究

Accelerating Social Science Research via Agentic Hypothesization and Experimentation

智能体系统Agent 架构与控制循环

摘要

数据驱动的社会科学研究本质上进展缓慢,依赖于观察、假设生成与实验验证的迭代循环。尽管近期的数据驱动方法有望加速这一过程的某些环节,但它们大多无法支持端到端的科学发现。为弥补这一空白,我们提出EXPERIGEN,一个Agentic框架,它通过受贝叶斯优化启发的两阶段搜索将端到端发现付诸实施:Generator提出候选假设,Experimenter对其实证评估。在多个领域中,EXPERIGEN持续发现比先前方法多2-4倍的统计显著假设,其预测力高出7-17%,并自然扩展到包括多模态与关系型数据集在内的复杂数据情形。除统计性能之外,假设还必须新颖、有实证依据且可操作,才能推动真正的科学进步。为评估这些品质,我们对机器生成的假设开展专家评审,收集资深教师的反馈。在25个受评假设中,88%被评为中等或强新颖,70%被认为有影响力且值得推进,大多数展现出与高年级研究生水平研究相当的严谨性。最后,鉴于最终验证需要现实世界证据,我们对LLM生成的假设进行了首次A/B测试,观察到统计显著的结果(p小于1e-6)以及高达344%的大效应量。

通过Agentic假设生成与实验加速社会科学研究
图1:内循环:迭代细化循环。给定数据集 𝒟={(x_i,y_i)} 与种子假设 H_{i,1},系统经过 T 步进行细化。在细化步骤 j:(1) Generator 基于短期记忆 ℳ_{i,j} 提出假设 H_{i,j};(2) Experimenter 通过指定所需特征将假设可操作化;(3) Feature Annotator 用可操作化特征 f_H(例如 has_cite)扩充 𝒟;(4) Code Interpreter 在扩充后的数据上执行统计检验;(5) 返回由 p 值与效应量组成的证据 E_H(𝒟)=(p,δ)。记忆 ℳ_{i,j}={(H_{i,k},E_{H_{i,k}})}_{k<j} 累积此前步骤的假设-证据对,使 Generator 能够提出解决混杂因素或添加上下文限定词的细化方案。通过 Bonferroni 校正显著性检验(p<α/T)的假设将成为假设库 ℋ 的候选。编排多个细化循环的外循环见图 2。Generator 与 Experimenter 的确切提示见第 11.1 节。