论文
评估人工智能为癌症患者生成的摘要
Evaluating AI Generated Summaries for Cancer Patients
摘要
大语言模型 (LLM) 越来越多地集成到数字健康平台中,以生成复杂医疗数据的摘要。尽管这些模型可以改善患者的参与和沟通,但这些系统也引起了人们对临床环境中的准确性、忠实性 和安全性的担忧。在这项研究中,我们使用双重评估框架评估癌症患者护理应用程序中人工智能生成的摘要。人类领域专家,包括肿瘤学临床医生和面向患者的护理人员,从准确性、临床相关性和可读性等维度提供了总结质量的 真值 评估。与此同时,我们聘请了 LLM 作为评估者(LLM-as-a-judge)。在生成的摘要中发现了一些局限性,例如偶尔的遗漏和轻微的不准确。这些被系统地分析并用于迭代改进提示设计、证据约束和安全护栏。