论文
pAI-Econ-claude:用于人工智能辅助经济理论发展的门控人在环多智能体架构
pAI-Econ-claude: A Gated Human-in-the-Loop Multi-Agent Architecture for AI-Assisted Economic Theory Development
摘要
在许多社会科学研究任务中,例如经济学,基于 LLM 的代理必须产生不存在廉价的、任务完整的、机器可读的正确性信号的输出。这为多智能体系统带来了一个独特的可靠性问题:当没有组件可以证明最终结果时,应该如何组织生成、批评、协调和人类判断?我们通过 pAI-Econ-claude 来解决这个问题,这是一种用于人工智能辅助经济理论开发的门控式人机循环多智能体架构。代理通过可检查中间记录的共享工作区进行协调;专门的门诊断目标故障模式并推荐环回,而无需证明正确性;人工检查站保留着对那些代价高昂的决策的权力。我们根据非门控基线评估五个匹配的经济理论任务的架构。两名对配置不知情的评估者就所有五个成对排名达成一致,在四项任务中更喜欢门控架构,在一项任务中更喜欢基线。平均故障严重程度从 1.58 下降到 1.16,而总体有用性从 2.60 上升到 3.10。当现实检查拒绝了错误的市场结构前提并且证据审查促使对错误的福利主张进行修改时,观察到的最大收益发生了。反面案例表明,脚手架也会过度压缩经济上重要的机制。结果支持了一个有限的主张:门控监督提高了人工智能辅助经济理论的可审计性,而无需取代形式验证,不可逆转的人类判断的分配是比纯粹的智能体自主运行更具信息性的设计变量。该工作流程可在 https://github.com/maxwell2732/pAI-Econ-claude 上公开获取。