在 CGM 知情糖尿病咨询中对 大语言模型 和临床医生撰写的反应进行盲态多评估者比较评估
Blinded Multi-Rater Comparative Evaluation of a Large Language Model and Clinician-Authored Responses in CGM-Informed Diabetes Counseling
摘要
连续血糖监测 (CGM) 是糖尿病护理的核心,但清晰且富有同理心地解释 CGM 模式仍然非常耗时。基于检索的 大语言模型 (LLM) 系统在 CGM 知情咨询中的证据仍然有限。评估基于 LLM 的基于检索的对话代理 (CA) 是否可以支持患者理解 CGM 数据并为常规糖尿病咨询做好准备。我们开发了一个基于 LLM 的基于检索的 CA,用于 CGM 解释和糖尿病咨询支持。该系统生成简单的语言响应,同时避免个性化的治疗建议。十二个 CGM 知情案例是根据公开数据集构建的。 2025 年 10 月至 2026 年 2 月期间,6 名英国资深糖尿病临床医生每人审查了 2 个指定病例并回答了 24 个问题。在盲法多评估者评估中,CA 生成和临床医生编写的每个响应均由 3 名临床医生在 6 个质量维度上独立评分。还记录了安全标志和感知源标签。主要分析使用线性混合效应模型。总共 288 个独特的回复(144 个 CA 和 144 个临床医生)产生了 864 个评级。 CA 获得的质量得分高于临床医生的回答(平均 4.37 比 3.58),估计平均差异为 0.782 分(95% CI 0.692-0.872;P<.001)。最大的差异是同理心(1.062,95% CI 0.948-1.177)和可操作性(0.992,95% CI 0.877-1.106)。安全标志分布相似,两组中很少出现重大问题(3/432,各 0.7%)。基于检索的 LLM 系统可能具有作为 CGM 审查、患者教育和会诊前准备的辅助工具的价值。然而,这些发现并不支持自主治疗决策或无人监督的现实世界使用。