论文

起草转化影响摘要的人工智能代理的真实世界评估

Real-World Evaluation of an AI Agent Drafting Translational Impact Summaries

应用与实践科学研究

摘要

介绍。临床和转化科学奖 (CTSA) 项目必须记录其学者的研究影响,但手工整理每位学者的记录需要工作人员估计 15 个小时,而且无法扩展到整个队列。人工智能(AI)代理可以作为跨平台和跨学科收集学者数据的工具。方法。我们构建了一个人机循环人工智能代理,为每位学者收集一份来源证据档案,并起草一句话转化科学效益模型 (TSBM) 影响摘要供工作人员审查。我们在一个 CTSA 中心的影响报告工作流程中对 10 名职业发展 (KL2/K12) 学者进行了评估。两名评估人员独立将所有 507 项调查结果编码为接受、编辑或拒绝;主要衡量标准是一致可用率,定义为接受或编辑的份额。结果。两位审稿人均接受或编辑了 81.7% 的智能体调查结果。每个学者的审稿时间中位数为 14 分钟,取代了估计 15 小时的手动组装。评估者之间的一致性中等(Cohen 在可用与拒绝决策上的 kappa 0.43)。一项档案发现研究发现,该智能体的召回率接近于人类搜索。该代理的影响证据涵盖所有四个 TSBM 领域,大约三分之一的审查结果属于常规流程往往会遗漏的非学术类别。审稿人按照 5 分制评分,综合准确性为 4.5 分,实用性为 4.8 分。结论。人机交互的人工智能代理可以充当学者影响力记录的第一手作者,将工作人员从收集和写作转移到审阅,并使队列规模的影响力报告变得可行。