论文
LLM 智能体能生成真实世界证据吗?评估医学数据库中的观察性研究
Can LLM Agents Generate Real-World Evidence? Evaluating Observational Studies in Medical Databases
摘要
观察性研究能够规模化地产出临床可操作的证据,但在真实世界数据库上执行此类研究是开放式的,需要在队列构建、分析和报告之间做出连贯一致的决策。此前对 LLM 智能体的评估强调孤立步骤或单一答案,忽略了所得证据包的完整性与内部结构。为填补这一空白,我们提出 RWE-bench,一个以 MIMIC-IV 为基础、源自同行评审观察性研究的基准。每个任务提供对应的研究方案作为参照标准,要求智能体在真实数据库中执行实验并迭代生成树状结构的证据包。我们在三种智能体脚手架下评估六个 LLM(三个开源、三个闭源),同时使用问题级正确性与端到端任务指标。在 162 个任务上,任务成功率很低:最佳智能体达到 39.9%,最佳开源模型达到 30.4%。智能体脚手架同样影响显著,造成性能指标超过 30% 的波动。此外,我们实现了一种自动化队列评估方法,用于快速定位错误并识别智能体的失败模式。总体而言,这些结果凸显了智能体在产出端到端证据包能力上的持续局限,高效验证仍是未来工作的重要方向。代码与数据见 https://github.com/somewordstoolate/RWE-bench。
