论文

HLER:经由多Agent流水线的人机协同经济研究

HLER: Human-in-the-Loop Economic Research via Multi-Agent Pipelines for Empirical Discovery

智能体系统Agent 架构与控制循环

摘要

大型语言模型(LLM)催生了旨在自动化科学研究工作流的基于Agent的系统。大多数现有方法聚焦于完全自主的发现,AI系统以最少的人类参与生成研究想法、进行分析并产出论文。然而,经济学和社会科学的实证研究提出了额外约束:研究问题必须扎根于可用数据集,识别策略需要精心设计,且人类判断对评估经济意义仍然必不可少。我们提出HLER(Human-in-the-Loop Economic Research),一个支持实证研究自动化同时保留关键人类监督的多Agent架构。系统编排专门化Agent执行数据审计、数据画像、假设生成、计量分析、论文起草和自动评审。一个关键设计原则是数据集感知的假设生成:候选研究问题受数据集结构、变量可得性和分布诊断的约束,减少不可行或幻觉假设。HLER还实现双循环架构:筛选并选择可行假设的问题质量循环,以及自动评审触发再分析和论文修订的研究修订循环。人类决策闸门嵌入关键阶段,让研究者引导自动化流水线。在三个实证数据集上的实验表明,数据集感知的假设生成在87%的案例中产生可行的研究问题(无约束生成仅41%),而完整的实证论文可以以平均每次运行0.8–1.5美元的API成本产出。这些结果表明,人机协同流水线可能是迈向可扩展实证研究的一条实用路径。

HLER:经由多Agent流水线的人机协同经济研究
图1:HLER系统架构。编排器(orchestrator)协调一条多智能体实证研究流水线。核心工作流包括数据审计、数据画像、问题生成与筛选、计量经济分析、论文撰写与自动化评审。图中展示了两个反馈回路:问题质量回路(左),其中候选问题在人工挑选前先生成并筛选;以及研究修订回路(右),其中评审智能体通过Econometrics与Paper智能体触发重新分析与论文修订。人工决策关口允许研究人员挑选研究问题并批准最终输出。