论文

MedConv:多语言临床记录生成基准

Symphony for Text Generation: Benchmarking Clinical Note Generation

模型评测基准与评测资源

摘要

环境记录系统正在迅速获得采用,但其对临床记录质量的影响仍不清楚。我们引入了 MedConv,这是一个包含 300 例英语、丹麦语和德语临床病例的多语言数据集,并将其与 Ambient Clinical Intelligence 基准 (ACI-BENCH) 一起使用,以将临床 AI 平台 Corti 与基于通用 AI 构建的两种领先、易于访问的环境抄写软件应用程序进行比较。我们提出了一个受控的临床评估框架,该框架将蕴含指标与 PDSQI-9 采用的八个维度上的 LLM 判断的成对比较相结合。结果表明,Corti 基于 API 的文本生成基础设施与领先的商业抄写员相当或优于领先的商业抄写员。我们进一步表明,Corti 的可配置 API 为特定文档用例提供了微调质量维度所需的灵活性。我们提出了评估方法并发布了一个数据集,以支持未来环境文档系统的可重复比较。

MedConv:多语言临床记录生成基准:论文原图
图 2:PDSQI-9 对 SOAP 的偏好评分,将 Corti 与每个评估的系统进行比较。