科学检索系统可以找到与问题相关的论文,但它们通常不会评估这些论文提供的证据的质量。我们推出了 Kurate,一个使用大语言模型 (LLM) 来评估已发表研究质量的系统。 Kurate 使用该论文及其相关文件(例如,该研究的试验注册和方案),并将其每个判断与该判断所依据的文本段落联系起来。我们将 Kurate 应用到包含 4,347 篇论文(其中 3,913 篇报告随机试验)的语料库中,并根据研究设计和报告的 8 个维度对每篇论文进行评分:具体来说,统计功效、因果识别、预注册、选择性报告、测量有效性、分析预设、报告透明度以及利益冲突和资助。在语料库中,我们发现论文最常表现出统计功效、选择性报告和分析预设方面的问题,尽管临床领域之间的平均质量有所不同。与 60 个 保留测试 临床试验文件的专家标注进行比较时,Kurate 提取的信息在 221/242 个方案得分点和 294/370 个结果发表得分点上与专家标签相匹配,AC1 分别为 0.94 和 0.81。我们以一项享有盛誉的高质量临床试验为例,展示了一篇论文的总体评分如何分解为单独的判断,每个判断都与试验注册、方案和已发表报告中的具体证据相关联。总之,这些结果表明这种大规模的质量评估是可行的,并且它可以用来解决元科学研究问题。
图 2:Kurat 管道。粗体的舞台名称对应于图中的方框。摄取/源捕获收集已发表的研究报告及其链接文档,并提取书目信息、全文、表格、图形、注册表和协议标识符、资助声明以及解析过程中遇到的任何问题的记录。确定性知识图使用固定规则(即没有 LLM)来构建知识图(KG),知识图是连接论文、相关文档、作者、资助者、注册、文本段落、表格和图形的链接记录的数据库。 KG swarm语义提取使用一组基于LLM的智能体来提取需要解释文本的信息。这包括哪些结果是主要或次要的、治疗和比较条件的组成、研究了哪些疾病、样本量和统计功效的证据、研究参与者的流动、论文是否同意其注册和协议,以及有关资金和利益冲突的信息。评级根据 Kurate 的质量维度(附录 C)对这些信息进行评分。这会产生每个维度的分数(如果证据支持研究的质量,则为正值;如果表明存在问题,则为负值),总体分数介于 0 和 1 之间(归一化分数),以及字母等级。硬评估检查是否存在严重问题,无论其等级如何,都可以排除使用论文作为证据的可能性。此类问题的示例包括文件不是实证报告、缺乏随机性、注册与发布的报告之间存在冲突、大量缺失数据以及结果不支持的主要主张。执行评估/裁决将分数、这些检查的结果以及任何不确定性或警告结合起来,最终决定该论文是否应用作证据。 Reports 为每篇论文生成一份报告,其中显示证据、每项证据的来源、分数、警告以及最终决定的原因。派生数据库表面更新用于搜索和语料库级别分析的汇总表(例如,按主题、药物和资助者进行的汇总)。验证/升级检查每篇论文记录的完整性和一致性,并将经过完全处理的论文添加到用于浏览、搜索和元科学分析的精选数据库中。