论文

忠实于设计:评估和改进 LLM 为多利益相关者受众生成的临床试验摘要

Faithful by Design: Evaluating and Improving LLM-Generated Clinical Trial Summaries for Multi-Stakeholder Audiences

模型评测基准与评测资源

摘要

大语言模型 越来越多地用于为医疗保健提供者、患者和付款人总结临床试验结果,但他们的幻觉倾向在这种高风险背景下构成了重大风险。本研究引入了一个基准评估框架,用于测量 LLM 生成的跨三个利益相关者受众的临床试验摘要的 忠实性。该框架由来自 ClinicalTrials.gov 数据库聚合分析的 200 项分层试验组成,并使用特定于受众的提示模板和六维 忠实性 注释模式进行评估。使用跨编码器自然语言推理 (NLI) 模型对 1,800 个生成的摘要进行评分,为 GPT-4o、Claude Sonnet 4.6 和 Gemini 2.5 Flash 建立了基线测量。不受支持的索赔被认为是所有三个模型中的主要失败模式,平均注释得分为 1.55(满分三)。开发了知识图增强检索系统,并根据基线进行了评估,在基于 NLI 的 忠实性 分数上产生了统计上显着的改进(蕴含 +0.0125,忠实性 +0.0130,p < 0.0001)。改进路径取决于模型,GPT-4o 主要通过减少矛盾来改进,而 Claude Sonnet 4.6 和 Gemini 2.5 Flash 通过增加蕴涵来改进。