论文

Scalable Delphi:用于结构化风险估计的大语言模型

Scalable Delphi: Large Language Models for Structured Risk Estimation

智能体系统Agent 协作

摘要

高风险领域的定量风险评估依赖结构化专家征询来估计不可观测的性质。金标准——德尔菲法——能产生经过校准、可审计的判断,但需要数月的协调与专家时间,使严格的风险评估对多数应用而言遥不可及。我们研究大语言模型(LLM)能否充当结构化专家征询的可扩展代理。我们提出Scalable Delphi,将经典协议适配于LLM,采用多样化的专家角色、迭代精炼与理由共享。由于目标量通常不可观测,我们开发了一个基于必要条件的评估框架:对照可验证代理量的校准、对证据的敏感性,以及与人类专家判断的一致性。我们在AI增强的网络安全风险领域开展评估,使用三个能力基准与独立的人类征询研究。LLM专家组与基准真值达到强相关(Pearson r=0.87-0.95),随证据增加而系统性改善,并与人类专家组对齐——在其中一个对比中,它比两个人类专家组彼此之间更接近某个人类专家组。这表明基于LLM的征询可以把结构化专家判断扩展到传统方法不可行的场景,把征询时间从数月缩短到数分钟。