AI聊天模型能否检索到专家选择的医学研究?
Do AI chatbots find what experts would? Effects of model, user role, and sample size on study retrieval for medical questions
摘要
大语言模型 (LLM) 聊天机器人越来越多地用于回答临床问题并引用相关临床研究。先前的研究主要集中在引文伪造上,在评估检索到的研究的质量和驱动其选择的因素方面存在差距。在本研究中,我们评估了三个通用 LLM 聊天机器人:Claude Sonnet 5、Gemini 3.1 Pro 和 ChatGPT GPT-5.5。我们用根据 2026 年 Cochrane 系统评价数据库第 6 期和第 7 期中的 20 个评论问题改编的临床问题来提示模型,模拟患者、临床医生和证据合成研究人员的角色。每个聊天机器人在每个用户角色下进行四次独立重复查询,产生 720 个响应。每个聊天机器人都被要求通过主要临床引文来支持其答案,我们将这些引文与 Cochrane 评论中包含和排除的研究集进行了基准测试。平均而言,聊天机器人的回复检索了 39.2% $\pm$ 29.8% 的 Cochrane 纳入研究,同时引用了 5.0% $\pm$ 9.4% 的排除研究。 Recall of Cochrane 纳入的研究因模型和用户角色的不同而存在显着差异。 ChatGPT 的召回率高于 Claude 或 Gemini(63.1% $\pm$ 29.5% vs. 37.0% $\pm$ 23.8% vs. 17.3% $\pm$ 13.1%;$p=2.0\times10^{-5}$)。研究人员角色的召回率高于临床医生或患者角色(42.8% $\pm$ 30.8% vs. 38.6% $\pm$ 28.9% vs. 36.1% $\pm$ 29.3%;$p=2.0\times10^{-5}$)。在控制出版年份、每年引用次数和开放获取状态的情况下,样本量是检索的唯一独立显着预测因素(对数样本量每增加 1 个单位,优势比为 1.80,95% CI 1.37-2.36,$p=2.34\times10^{-5}$)。这些发现表明,虽然 LLM 聊天机器人可以检索专家评审员确定的一些研究,但它们的性能因模型和用户角色而异,并且它们对较大样本量的临床试验表现出偏见。