论文

OpenHospital:用于演化和基准评测基于LLM集体智能的自在之物竞技场

OpenHospital: A Thing-in-itself Arena for Evolving and Benchmarking LLM-based Collective Intelligence

智能体系统Agent任务评测

摘要

基于大语言模型(LLM)的集体智能(CI)为突破数据墙并持续提升LLM智能体能力提供了一条有前景的途径。然而,目前尚无专门用于演化与基准评测基于LLM的集体智能的竞技场。为填补这一空白,我们提出OpenHospital,一个医生智能体可通过与患者智能体交互来演化集体智能的交互式竞技场。该竞技场采用data-in-agent-self范式,快速增强智能体能力,并为医疗水平与系统效率两方面的基准评测提供稳健的评估指标。实验证明了OpenHospital在培育与量化集体智能两方面的有效性。

OpenHospital:用于演化和基准评测基于LLM集体智能的自在之物竞技场:论文配图
图1:患者智能体在固定问题集上的交互式回复多样性,反映OpenHospital中智能体群体行为的丰富程度。