论文
KnowBench:以工作量减少衡量临床AI的部署价值
KnowBench: Effort Reduction as a Unified, Deployment-Grounded Benchmark for Clinical AI
摘要
临床AI通常用研究场景的参考相似性指标和专家评分板评估,衡量的是与产物相似程度而非负担减少。我们提出由Knowtex开创的KnowBench,统一指标为工作量减少ER:在专家与安全审核下,负责医生接受的系统生成临床工作产物比例。ER统一定义后用于临床AI自动化的行政工作,包括就诊记录、诊断与计费编码、医嘱、电子病历摘要、患者诊后摘要和临床决策支持。每种实例构造相同:医生审核确认事件是真值,每个接受单元是系统完成的工作,每次纠正是返还给医生的剩余劳动。本文主要贡献是基准本身,包括指标、退化情况及使ER主张可审计、可跨系统比较的报告协议。我们同时报告文书实例的初始主要测量:在超过六个月、十三个专科、逾一百万次签署就诊记录中,Knowtex专有微调临床基础模型在闭环反馈架构下汇总ER为97.99%,各专科为96.8—98.9%。本次发布仅报告部分协议清单,并说明哪些配套统计未公开;基准旨在使该数字与未来结果接受同一标准约束。