论文

(人类的)注意力仍然是全部所需:人类监督使AI辅助社会科学可靠

(Human) Attention Is (Still) All You Need: Human oversight makes AI-assisted social science reliable

智能体系统Agent 动作执行与治理Agent Harness

摘要

大型语言模型 (LLM) 越来越多地用于执行曾经由受过训练的研究人员保留的任务,包括假设生成、规范选择和起草结论。我们认为,人工智能辅助研究的可靠性不仅取决于模型能力,还取决于人类和机器之间认知劳动的结构。我们通过人在环经济研究(HLER)来研究这个问题,这是一种基于预先承诺、决策排序、问责制和注意力分配的决策架构。在预先指定的 2*4 因子实验中,在四个数据集上进行了 280 次完整的研究运行,无约束的多智能体基线在 72% 的运行中产生了严重失败。使用相同的底层模型、相同的代理分解以及相同的共享推理代理提示,HLER 通过实施三个架构承诺将失败率降低到 16%:LLM 推理但不执行数据工作、确定性地处理数据和估计以及三个人工决策门绑定工作流。 Fisher 精确检验拒绝 p<0.001 时的失败率相等。在最不公开的数据集(清朝人口登记册)上,可靠性增益最大,与具有 Frechet 分布输出质量的基于任务的生产模型一致。 80 次运行的消融表明确定性计算和人类门是独立贡献的,并具有互补性的探索性证据。我们将 HLER 解释为一个研究工具,而不是一个自主的人工智能科学家:它大大减少了失败,使残留的弱点更加明显,并防止不可靠的主张被提出为可发表的输出。

(人类的)注意力仍然是全部所需:人类监督使AI辅助社会科学可靠:论文配图
图 1:HLER 决策架构。专业代理分解实证研究工作流程。紫色阴影代理是概率性的(基于大语言模型的推理);蓝色阴影代理是确定性的(可执行代码)。人类决策门干预研究问题选择、识别策略审查和出版决策。 Orchestrator 维护运行状态,强制执行跨阶段一致性并生成审计跟踪。